Pith. sign in

Paper Citation Record · LEDGER

PROBE: Benchmarking Code Generation in Large Language Models

As of 18 August 2026, this Paper Citation Record lists 97 of 97 outbound references and 1 inbound Pith citation observation for arXiv:2607.13820.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.13820 v1

Coverage vector

measured 97 of 97 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-02T03:41:08.536430Z

measured 98 of 98 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T01:05:44.021875Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

97 of 97 outbound references displayed

  • verified exact1
  • verified fuzzy0
  • unresolved96
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation a410a632-1763-4eae-b526-daed9a6618b6 · outbound

This paper cites an unresolved cited work.

PROBE: Benchmarking Code Generation in Large Language Models Unresolved cited work

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.041633Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.041633Z digest=sha256:7728ed30a75acd0419337bd90e2ec8b5cab54e0979956e141e9a29989b444c55

Observation 46f6024f-dc71-42bb-9e7d-8536f2e661b7 · outbound

This paper cites , title =.

PROBE: Benchmarking Code Generation in Large Language Models , title =

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.077840Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.077840Z digest=sha256:71b4df6723b8dfe2a175e1479a67582d4a3195723d8bb6397df8e2c55e9ec747

Observation 5555c998-53eb-458d-a936-7eccee424179 · outbound

This paper cites , title =.

PROBE: Benchmarking Code Generation in Large Language Models , title =

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.127050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.127050Z digest=sha256:3b24567abe7b64a4602fef487e770f6db8c8ba841b8c769396c545bf85f4c090

Observation 04b2ea7e-5742-4ea3-8061-20c2378e1832 · outbound

This paper cites an unresolved cited work.

PROBE: Benchmarking Code Generation in Large Language Models Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.187776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.187776Z digest=sha256:40fd6f59a5492391b59d0203beb8491111361b3f8052b9f215a3c308f17ff7fc

Observation ca44938c-c300-45e0-baed-3f7865d2123a · outbound

This paper cites 2021 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , eprint=

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.240390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.240390Z digest=sha256:cecc75be427314b56eac2ee15e7c5fa320747e3fd27327a8ba181f87909316aa

Observation db678837-a4c4-4847-947b-1c4be834457f · outbound

This paper cites Alice and Rice, Andrew and Rifkin, Devon and Simister, Shawn and Sittampalam, Ganesh and Aftandilian, Edward , title =.

PROBE: Benchmarking Code Generation in Large Language Models Alice and Rice, Andrew and Rifkin, Devon and Simister, Shawn and Sittampalam, Ganesh and Aftandilian, Edward , title =

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.328176Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.328176Z digest=sha256:323d14471829229bbfbdafb786616f8b4ce8687ec12a0f74e4a53559e631104f

Observation b8194cc0-d9d1-4ecd-8966-eb885e5e2480 · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.428297Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.428297Z digest=sha256:9d8b82acf1378877a68ed45b6df60b9dc915f72e17ffefb29596a43b8a0322e5

Observation 481876de-ea26-4800-8cc8-012518bb2298 · outbound

This paper cites Qwen2.5 Technical Report.

PROBE: Benchmarking Code Generation in Large Language Models Qwen2.5 Technical Report

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.516100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.516100Z digest=sha256:99bebf8b89ef75f92b1d751c17870227982739ae0b32800647e06cec9f68db12

Observation 56a8bc06-989c-4ddc-b604-4033f04747ee · outbound

This paper cites 2024 , publisher=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , publisher=

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.591302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.591302Z digest=sha256:2335df358d8f4a6beb5a751097e7550a2ccbb627a45364111aa3bcc6ecf1db4c

Observation bc7dcfd6-2643-4eed-b818-f124e6e1eb63 · outbound

This paper cites Language Models are Few-Shot Learners , url =.

PROBE: Benchmarking Code Generation in Large Language Models Language Models are Few-Shot Learners , url =

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.681179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.681179Z digest=sha256:af53f1a57e95c18b3a3f7cb33181cccc3ee5725d5f70e942009879cb21b61020

Observation b1d2a032-cfc3-4f04-a76a-bc1b15b2d774 · outbound

This paper cites 2021 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , eprint=

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.764700Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.764700Z digest=sha256:f598bf4061081da56c450851aa0dcff5f83ff749ef1b3d4288d4e6cc7dd3a312

Observation 34e701d1-0d7c-482a-a9e8-58ae65754832 · outbound

This paper cites 2021 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , eprint=

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.836997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.836997Z digest=sha256:6161b3cd43f393657c58fb3597cd6e37f6446f1b3f9c7ade734f35dc9da95aa2

Observation 737ed91b-eb48-4f57-820f-35a99cf0d527 · outbound

This paper cites 2023 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2023 , eprint=

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.912370Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.912370Z digest=sha256:2ba1de20133762ca9f5e5ff0b157cffd3a41429507175f6c33268bff3c45eb2e

Observation c286d5d3-bd91-4dcf-ba30-de49db1c824d · outbound

This paper cites 2021 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , eprint=

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.994552Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.994552Z digest=sha256:09f7451a48d0a171657de5d03ff6e98b0e549f13fd1681ef1590e561c6c5afc2

Observation ab136e6a-125f-46b0-86a6-c37ca5c5311f · outbound

This paper cites Attention is All you Need , url =.

PROBE: Benchmarking Code Generation in Large Language Models Attention is All you Need , url =

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.032812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.032812Z digest=sha256:fb6704dcb406b799b1437b3abe0fa1dcc49fb53ccb4c013f716b3573e6de6c53

Observation 0f4253f5-7891-434b-b9fe-eea90dcd8fdc · outbound

This paper cites Long Short-Term Memory.

PROBE: Benchmarking Code Generation in Large Language Models Long Short-Term Memory

Reference 16

Resolution
verified exact
doi, observed 2026-08-02T03:43:22.735297Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-02T03:41:00.083856Z digest=sha256:4accdfc54f06b50155fbe94ab9d33760e77a973090c2c078f289e5689c4c82a0

Observation e8829be0-b76f-406a-811d-5261067a277c · outbound

This paper cites an unresolved cited work.

PROBE: Benchmarking Code Generation in Large Language Models Unresolved cited work

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.142904Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.142904Z digest=sha256:1832a932e9370cc2f6bda1bccec2c7e6d6f3de11f2529e20216f30ef64f31927

Observation 5f7b12dd-6f89-4f12-9f6d-4a0a5ac213ac · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.197477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.197477Z digest=sha256:48285fa03b28520cb9542efcacb6768ae8f3dbc5d8f0653f0dd39f58ee227335

Observation 4b13adc5-9e79-44a0-a88e-5032b32c363e · outbound

This paper cites 2002 , publisher =.

PROBE: Benchmarking Code Generation in Large Language Models 2002 , publisher =

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.254344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.254344Z digest=sha256:39787dee026da0b03a0db0738ce1c9e1539050aef865889f6f8d74e1880abb73

Observation cef076cf-bbeb-417f-a1df-92be8bb7f835 · outbound

This paper cites Text summarization branches out , pages=.

PROBE: Benchmarking Code Generation in Large Language Models Text summarization branches out , pages=

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.340873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.340873Z digest=sha256:7b47ed3810ecafb4ae062304ea4919952037a3880a396faa1b6ae94d43646c0f

Observation 2543796d-21fe-43a7-bb3e-8c34101e8b3c · outbound

This paper cites Proceedings of the acl workshop on intrinsic and extrinsic evaluation measures for machine translation and/or summarization , pages=.

PROBE: Benchmarking Code Generation in Large Language Models Proceedings of the acl workshop on intrinsic and extrinsic evaluation measures for machine translation and/or summarization , pages=

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.403280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.403280Z digest=sha256:b060e2858d9e6692e296207e85178de194b706f0f51240b1eda03378416eb109

Observation 527405ba-9a91-436e-846c-d94289d7ef8d · outbound

This paper cites 2020 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2020 , eprint=

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.462363Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.462363Z digest=sha256:b443eba59bd7721c009988e8d44f7ae92817d21af08ed26af74c697abb65154e

Observation 2bc85aca-64f6-414d-86b1-2419ec2fc1d0 · outbound

This paper cites 1992 , publisher=.

PROBE: Benchmarking Code Generation in Large Language Models 1992 , publisher=

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.535796Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.535796Z digest=sha256:d37e8e98fb7c3637bd6ab8ac34efe2227f230800ad5ceee38fbedd8403d0a465

Observation 11f245cf-2c48-476d-a9ad-d23f72615d46 · outbound

This paper cites Synthesize, Execute and Debug: Learning to Repair for Neural Program Synthesis , url =.

PROBE: Benchmarking Code Generation in Large Language Models Synthesize, Execute and Debug: Learning to Repair for Neural Program Synthesis , url =

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.598390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.598390Z digest=sha256:4f667625617547950ad2168ee14fe6f224de53e39522be8e3a9d23fb78cc388d

Observation 9ba4e8c5-9750-471e-b948-7261049bf8cc · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.682028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.682028Z digest=sha256:70a5a5ccc78d76bfb678da6fb66d8c0dacfd2f834dd7b6f55117a3d3052ffbb1

Observation df89dfc2-c769-4ba0-9626-0a7a2e75aaa0 · outbound

This paper cites 2023 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2023 , eprint=

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.751011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.751011Z digest=sha256:1215f58508996d5b1953fb590a98e2faee8fa10dd7041217fb89293e991690a9

Observation 957690fe-b84f-4000-ad60-393ca88e9371 · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.833125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.833125Z digest=sha256:0ee4bbab4da4daf5be33079952cb1fe0ee6d8a0f7f2eeffa585080858e8e45ba

Observation bb6c933d-b19c-42cb-bdfa-d60bca05576b · outbound

This paper cites 2017 , volume =.

PROBE: Benchmarking Code Generation in Large Language Models 2017 , volume =

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.896613Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.896613Z digest=sha256:b1cafb7da6e9011f499e1047aba744bc2a9771ebacab835444a4000c66b5fe37

Observation 7a3fc547-5788-410d-a981-6dfcc876fe09 · outbound

This paper cites Predicting a Correct Program in Programming by Example.

PROBE: Benchmarking Code Generation in Large Language Models Predicting a Correct Program in Programming by Example

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.949870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.949870Z digest=sha256:f84b6d65127737d2964daeb68e83c652e6337f80e70ea203a862a6f7bc0b14f5

Observation d0cfd897-0205-4523-8c02-61ed823bd4c1 · outbound

This paper cites SPoC: Search-based Pseudocode to Code , url =.

PROBE: Benchmarking Code Generation in Large Language Models SPoC: Search-based Pseudocode to Code , url =

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.006976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.006976Z digest=sha256:3119519b685f228766da43502c61b43be14661ab75f9203213373fbc084c6127

Observation 4f7c1253-f23b-4c76-8a62-dad4aa3e61ae · outbound

This paper cites Neural Attribution for Semantic Bug-Localization in Student Programs , url =.

PROBE: Benchmarking Code Generation in Large Language Models Neural Attribution for Semantic Bug-Localization in Student Programs , url =

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.101322Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.101322Z digest=sha256:7542a322f42dcae3d21a65053dd9e8cd0c4229969198ea4ba408d749017c7f82

Observation e7f33a20-97cd-4cd7-b250-1b049ce514a2 · outbound

This paper cites 2021 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , eprint=

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.162778Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.162778Z digest=sha256:377e8165060ee6d207c228f68e5607544e985cbfcea5bddd9ff1aa12ca71d78d

Observation b57e87ba-a056-40b5-86b1-beeba0e1b69b · outbound

This paper cites Liu , title =.

PROBE: Benchmarking Code Generation in Large Language Models Liu , title =

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.232166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.232166Z digest=sha256:4da654f95dcf8e7a53d460a5cfb0a6df32bbf85b735586213f6f4c5fa7af8428

Observation 040faf8b-a86b-492f-9022-c124e6de4d4f · outbound

This paper cites Distributed Representations of Words and Phrases and their Compositionality , url =.

PROBE: Benchmarking Code Generation in Large Language Models Distributed Representations of Words and Phrases and their Compositionality , url =

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.286929Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.286929Z digest=sha256:02be7940e0e013a28199565ab63d9b8968909abd4c5d48747df9c9b234333e8d

Observation b2ec3db1-d854-47de-9cd7-6919cdd8b47d · outbound

This paper cites Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP) , pages=.

PROBE: Benchmarking Code Generation in Large Language Models Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP) , pages=

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.377487Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.377487Z digest=sha256:5f5383057a996d1bd6fc696ed9376fccbf08dbca14a2b5ba7c994674631df919

Observation 493145d8-bd80-4e8e-8ae1-32cbcfaf7242 · outbound

This paper cites and Fei-Fei, Li , title =.

PROBE: Benchmarking Code Generation in Large Language Models and Fei-Fei, Li , title =

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.424056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.424056Z digest=sha256:79c67b6120f70055f6897cc99749b4f16e6d64171c8835ba2f980ed18e20883b

Observation 31fc5312-2cc7-4b43-9667-843c3dc6e76f · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.474006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.474006Z digest=sha256:1e92a00e5e10fce26250fa8c7bf24788918970caa16af5b485e5195f9a7f2b2d

Observation daf10398-a8ed-44b7-a6de-9a31f26315b4 · outbound

This paper cites 2019 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2019 , eprint=

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.522051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.522051Z digest=sha256:990d9d0b4fc7cb17244070bb047a308316dc56f56a9a569076fc53ad4432e878

Observation 563c8154-874e-47b5-ad18-dd3fec4f8107 · outbound

This paper cites 2021 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , eprint=

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.585939Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.585939Z digest=sha256:617eab216a1ebc288308b53a1ac765f13818beb15f059739e6ac3898baf4810e

Observation 2468b25b-588c-4326-a3b9-8032da3bf6f4 · outbound

This paper cites OpenAI blog , volume=.

PROBE: Benchmarking Code Generation in Large Language Models OpenAI blog , volume=

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.639757Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.639757Z digest=sha256:cfb8c38fa55bc13a875cf7fc518d83f088660073a2fb19b533f9cb10fe4beab1

Observation 652c8d91-ed11-4f33-85fa-d18e4c36dfdf · outbound

This paper cites 2023 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2023 , eprint=

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.675781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.675781Z digest=sha256:2daa886b9fa02f332af517c8b6e8940669382768d06edf889af9f21a984098b9

Observation 932c8d21-35d5-41ac-bac5-cb0944d16ccc · outbound

This paper cites 2021 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , eprint=

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.718188Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.718188Z digest=sha256:a679b9a2471035cd1f166115923674ffc044fe75e227ba4e76451748b71c9305

Observation a2f7f0e5-ae73-4fd4-b1a3-90c92128c65f · outbound

This paper cites Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages=.

PROBE: Benchmarking Code Generation in Large Language Models Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages=

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.769383Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.769383Z digest=sha256:7537718726dd8fc0a575783796a430da1bbc00c5fcdec56dd854a27df109855f

Observation e6940600-7ed7-43d8-bca9-0c5d656ae65d · outbound

This paper cites 2021 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , eprint=

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.803262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.803262Z digest=sha256:0180182ba4311729cb38f1b713cf2558ab0db9b0d205a324572988c118271cd0

Observation dc5f6d40-fcae-4e47-b8ef-bf8447568779 · outbound

This paper cites 2022 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2022 , eprint=

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.871602Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.871602Z digest=sha256:e0f041c7482ad034e402c8732d0353582ea61fe4b6440e172624a913274c280d

Observation 50612aee-d8d4-49cf-a4f6-b19898bee443 · outbound

This paper cites , title =.

PROBE: Benchmarking Code Generation in Large Language Models , title =

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.924993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.924993Z digest=sha256:474c74e3dc54e6d6f643f114554cb115cd467fccbb52a25789654f89754261f2

Observation 96776520-2829-4aac-8e21-a59e9828117e · outbound

This paper cites 2023 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2023 , eprint=

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.977621Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.977621Z digest=sha256:bfb6d06e24e6d0dc6778979177049190fb58c0ce29927cb260130cc792ec1e7b

Observation fcfae5a5-ebf1-4e7b-ad33-06f6bb59bbfc · outbound

This paper cites 2023 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2023 , eprint=

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.029969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.029969Z digest=sha256:79f4a1be0b28dc018ceba4ac42e52bdeb7eb0000f4e30f3db80d418f1fbb8a37

Observation d0708426-74c3-442a-bb29-d852c03f1b56 · outbound

This paper cites Right for the Wrong Reasons: Diagnosing Syntactic Heuristics in Natural Language Inference.

PROBE: Benchmarking Code Generation in Large Language Models Right for the Wrong Reasons: Diagnosing Syntactic Heuristics in Natural Language Inference

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.119264Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.119264Z digest=sha256:b9eaf85f3c5ce7665b2d3a12b513719aed251c8aa4426cefd75395320f7acf21

Observation c50e8c9f-9f79-4861-8750-e87aca657167 · outbound

This paper cites 2019 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2019 , eprint=

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.196404Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.196404Z digest=sha256:4ba302352efad9e10b5237488df7519dcf0eafb240de14dc6c8f2ca3a1439d24

Observation 00153917-8540-4ace-ad5b-d0ab58743f6b · outbound

This paper cites 2022 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2022 , eprint=

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.276767Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.276767Z digest=sha256:06d4823d62869a4bd02ee7ef5cac7244c825b46a2b8969b3d988b72bb4e2b8c3

Observation 8cdbf6bf-c228-48bb-9068-74f0e2fb4e12 · outbound

This paper cites 2023 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2023 , eprint=

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.328305Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.328305Z digest=sha256:24965fc78b4e42ff7b7066c253820129f90397e36bc3dbd2b0d3b81345b0d353

Observation 77bc4aa6-e016-447c-9548-7885e188a949 · outbound

This paper cites 2020 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2020 , eprint=

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.435612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.435612Z digest=sha256:d37962e6a2967ec33279dc662d133f6d2c626570e768d12b913e5e9db462d83a

Observation f4eab490-835d-4dcf-a8ae-814740c7fdc1 · outbound

This paper cites 2023 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2023 , eprint=

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.486791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.486791Z digest=sha256:acb42fefeb89e06b2b0cfb2f520ba7c6dd163773c120bc4b686dadc1738cf68e

Observation 1421c880-32d1-474a-ac36-7f6084a89b1d · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.489711Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.489711Z digest=sha256:99e712ecc1867ba21c73e6dfcd8fd16177210e46d6f41f1f52201f381284b385

Observation 49c2f4be-60da-4c7b-87cd-8254a55b813b · outbound

This paper cites Training language models to follow instructions with human feedback , url =.

PROBE: Benchmarking Code Generation in Large Language Models Training language models to follow instructions with human feedback , url =

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.555293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.555293Z digest=sha256:ca064f1335230e7abb94866e8d17e07d9fb21239ac5dc1a22aa51604e30244ee

Observation bd143f87-cee7-4d53-b105-b3510a51e39d · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.693353Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.693353Z digest=sha256:4253cedb8b8b2ac7a4d319370046e8c056df0435e38d0b6fa70bb5f7624be98c

Observation 0cdc6d04-4602-4cbe-9183-6aa0d4f67aba · outbound

This paper cites 2023 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2023 , eprint=

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.855468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.855468Z digest=sha256:24a265e2922e22f69a14b1a4ebcd9950e178da7086c4c4d63cd0e1b899b425fc

Observation fc2a8aa5-5343-4316-9cc9-3159358ed8aa · outbound

This paper cites HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models.

PROBE: Benchmarking Code Generation in Large Language Models HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.990486Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.990486Z digest=sha256:339b2a09d642462178363d649d79bb7989fbb9c4ed3367dd0af103d5b6f71432

Observation 0cedbebf-9d83-4555-9b52-d2d936a808d5 · outbound

This paper cites Advances in neural information processing systems , volume=.

PROBE: Benchmarking Code Generation in Large Language Models Advances in neural information processing systems , volume=

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.113431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.113431Z digest=sha256:10a94b5c181461d0a37cfb03a4931743aaba0bf0f230089fe985f3bf485c5d2f

Observation e145c4ee-625c-401d-8199-49cc5785808a · outbound

This paper cites Proceedings 2003 VLDB Conference , pages=.

PROBE: Benchmarking Code Generation in Large Language Models Proceedings 2003 VLDB Conference , pages=

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.187782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.187782Z digest=sha256:10ea068ed725be466667a91ca22480c6b9ab7f28a56182ee16235073fbeb28bb

Observation f10755b6-7956-4da4-9cfb-391268150286 · outbound

This paper cites 2021 , publisher =.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , publisher =

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.310408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.310408Z digest=sha256:eefcb54bce9d0a4cee6c0d3c4bcf0cc408ccff21d19be610809f908d48dd5b74

Observation df0dfbb5-133d-40d1-8560-6176b9010b83 · outbound

This paper cites an unresolved cited work.

PROBE: Benchmarking Code Generation in Large Language Models Unresolved cited work

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.430829Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.430829Z digest=sha256:fb8d957f6a66a86597812f338e8191c2d459c8ebb63a9cf60e8052df6d097001

Observation 7a7ba2e0-ce04-4245-875e-29e24b32a7e0 · outbound

This paper cites Mapping Language to Code in Programmatic Context.

PROBE: Benchmarking Code Generation in Large Language Models Mapping Language to Code in Programmatic Context

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.553027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.553027Z digest=sha256:f33429489f8d4b3d0825b96f74b6a8ba8e47d16b0697388250c1b6d5a5a25425

Observation e9b2af0c-f4eb-4659-8862-7a2d63f61952 · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.670850Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.670850Z digest=sha256:29a2676b231ba217780da1ed48b25cbddb61174c6964ad902dc3bfbdda2a51db

Observation 1d9daa2e-6d8a-459d-b00e-f3f679847326 · outbound

This paper cites 2022 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2022 , eprint=

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.792906Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.792906Z digest=sha256:470bc97c2203f23c15080a054d53199499239ccc9ad77813d037110730a1699f

Observation 485e5059-decb-40fe-9846-dd5874deaa3b · outbound

This paper cites 2022 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2022 , eprint=

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.873151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.873151Z digest=sha256:f141fb264603c841d44f575e29abc95d6ef43440b09f3be879420636a3afdddd

Observation c0bba666-ab21-4e44-866a-0539991f3d35 · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.997658Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.997658Z digest=sha256:a1ee5106a9a219dc35a850d10c753facc4fe8a07aa6e94826b520b27bbd358ba

Observation a5989be4-e0d2-47cf-8527-6545042c4728 · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:04.116893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:04.116893Z digest=sha256:9a41dcc0a36a61cd383a93af7b4802f64f328799ce6761d13d3780e94ae2d581

Observation 0ef7664c-32b3-40ae-9415-9e80a88179af · outbound

This paper cites International conference on machine learning , pages=.

PROBE: Benchmarking Code Generation in Large Language Models International conference on machine learning , pages=

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:04.236798Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:04.236798Z digest=sha256:4315e1e8b5da12d346aeae52d7527b97c6e5ecd323036f9a7c2e3f923e48e53c

Observation 4370a0a0-4ad2-4be9-b247-33a7b29c51c6 · outbound

This paper cites Distilling Knowledge from Reader to Retriever for Question Answering.

PROBE: Benchmarking Code Generation in Large Language Models Distilling Knowledge from Reader to Retriever for Question Answering

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:04.355532Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:04.355532Z digest=sha256:2966863f78b6947c63e52aeb656b5482e5d5854e59d6183fa0afc9010b470c28

Observation 46c049ac-8041-4a70-b333-fc67f9a7f2de · outbound

This paper cites Let's Verify Step by Step.

PROBE: Benchmarking Code Generation in Large Language Models Let's Verify Step by Step

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:04.479139Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:04.479139Z digest=sha256:7aacc5469c00d8d59f5c206e0c012d7255e101976f1e4fb437d74133d0651ce3

Observation 39316138-77e0-4488-9ed2-8989be2131aa · outbound

This paper cites Generating Natural Language Proofs with Verifier-Guided Search.

PROBE: Benchmarking Code Generation in Large Language Models Generating Natural Language Proofs with Verifier-Guided Search

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:04.562180Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:04.562180Z digest=sha256:c0eac98d6e8b621ca44426fda72717b3c3ab146fbc42c8b06caff6555f4dea13

Observation b91aafdb-bc61-4327-91df-217fb0944e1d · outbound

This paper cites StarCoder: may the source be with you!.

PROBE: Benchmarking Code Generation in Large Language Models StarCoder: may the source be with you!

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:04.657260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:04.657260Z digest=sha256:f2818bc117abd57b28c84fdfd384be43cbbb5604738a3f702df25abfc6a9eaab

Observation fba60d61-8335-44a9-becd-1728c132b945 · outbound

This paper cites Annotation Artifacts in Natural Language Inference Data.

PROBE: Benchmarking Code Generation in Large Language Models Annotation Artifacts in Natural Language Inference Data

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:04.739473Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:04.739473Z digest=sha256:1c517cca5e0596e3126ad07c171d8b78625bda7850303f6bde87644c784c0109

Observation 7e65b358-3a1f-4f0f-b8ae-b5d39fada2a7 · outbound

This paper cites Non-Determinism of "Deterministic" LLM Settings.

PROBE: Benchmarking Code Generation in Large Language Models Non-Determinism of "Deterministic" LLM Settings

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:04.881119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:04.881119Z digest=sha256:23971a20919f0c869b20af58283e96002ba1ecd2605d4265d235d7de25a9a6a1

Observation c1899611-320c-41f7-9c33-ebae04e3f7ce · outbound

This paper cites Large Language Models are Zero-Shot Reasoners , url =.

PROBE: Benchmarking Code Generation in Large Language Models Large Language Models are Zero-Shot Reasoners , url =

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:05.042606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:05.042606Z digest=sha256:fdef8622fb8fe121587b50f6ccdb5abc14dbe765f8a2dd83af3b3a6d05983d4b

Observation dbd2cbc5-ae6f-4ab3-8bab-0d48cb393f64 · outbound

This paper cites Density-Based Clustering in Spatial Databases: The Algorithm GDBSCAN and Its Applications , journal =.

PROBE: Benchmarking Code Generation in Large Language Models Density-Based Clustering in Spatial Databases: The Algorithm GDBSCAN and Its Applications , journal =

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:05.143110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:05.143110Z digest=sha256:0c2008e0fe49be32e8476698641d2866134e7033a3778e3ac48c6218bee1eff3

Observation 747fa17c-127d-4c4e-a779-9cd649416b2a · outbound

This paper cites A Survey on Mixture of Experts in Large Language Models.

PROBE: Benchmarking Code Generation in Large Language Models A Survey on Mixture of Experts in Large Language Models

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:05.245748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:05.245748Z digest=sha256:c2175a3d887ef55f8af6e62c185234df4624978a96de77de695217715a6c3f55

Observation e168f7ef-749e-474a-b1b4-521536b62bc4 · outbound

This paper cites Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer.

PROBE: Benchmarking Code Generation in Large Language Models Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:05.393633Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:05.393633Z digest=sha256:e46725e57ff53e8f852b24c97c367754aef06ecdfcf79632b7b3be0ef84e871d

Observation 4a630a48-8142-4033-9285-d8cd0de50098 · outbound

This paper cites Journal of Machine Learning Research , volume=.

PROBE: Benchmarking Code Generation in Large Language Models Journal of Machine Learning Research , volume=

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:05.619368Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:05.619368Z digest=sha256:8bc1d8fe9770ea482966afd12651d4f4eaecac2c8c1b952ca5ea50a4a338319d

Observation 42a60d18-10d9-41e5-b4f0-24799f274b3b · outbound

This paper cites DeepSeek-V3 Technical Report.

PROBE: Benchmarking Code Generation in Large Language Models DeepSeek-V3 Technical Report

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:05.769361Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:05.769361Z digest=sha256:cca3c712d2390c9300951c7934ec6a8c1826fd16ec6bed372d5e1d9c73c42b57

Observation 769737aa-f3e4-413d-9705-1ceb5af6b6c1 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

PROBE: Benchmarking Code Generation in Large Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:05.979493Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:05.979493Z digest=sha256:2cf919b7cf5cb9c2860b1c3ba5c4e24c3533fb13d95ca4744f9b520ed3da7c2a

Observation 2358ba9e-178d-4abc-a77b-bc30fbaf5b3d · outbound

This paper cites Journal of medical Internet research , volume=.

PROBE: Benchmarking Code Generation in Large Language Models Journal of medical Internet research , volume=

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:06.143522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:06.143522Z digest=sha256:41da601bb90736857364e1d7a18068348e2d04b4c4c6a7f37587b5088477c590

Observation b71dbb2c-c9f4-4dac-a76b-c9a7de4fbbf6 · outbound

This paper cites AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts.

PROBE: Benchmarking Code Generation in Large Language Models AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:06.319054Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:06.319054Z digest=sha256:b86b207cd870cd0f46ffccc11398bc425812be60fe36b2244b62a1a02b554946

Observation 1ac0563e-4fa9-4ef9-be9e-8daf2fca9e16 · outbound

This paper cites The Prompt Report: A Systematic Survey of Prompt Engineering Techniques.

PROBE: Benchmarking Code Generation in Large Language Models The Prompt Report: A Systematic Survey of Prompt Engineering Techniques

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:06.532907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:06.532907Z digest=sha256:ba72501c4f679c64f9c56b802a33882b559b7aaa7f4262da592868849485a149

Observation fcaac1ac-3bfd-4fa4-bdd8-21277b31af47 · outbound

This paper cites DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence.

PROBE: Benchmarking Code Generation in Large Language Models DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:06.722239Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:06.722239Z digest=sha256:e8b2f39e79a32155b8f4c65b4a2235cb744d64f1500a1df340c8f5b6a83de552

Observation 6358adc9-4ed3-470e-bc4b-ae51a0f6c75f · outbound

This paper cites 2022 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2022 , eprint=

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:06.967903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:06.967903Z digest=sha256:2d1b57571cbe1e956158558c48b74e956150b317941d59c11369c676ca8c2036

Observation 1560eeaa-801d-4787-91b3-738f50d41df5 · outbound

This paper cites 2022 , howpublished =.

PROBE: Benchmarking Code Generation in Large Language Models 2022 , howpublished =

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:07.110645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:07.110645Z digest=sha256:452c66681480c69bbb01158fd7094ea0282dd3ea70fa86867a0e36ecdcc1f326

Observation 5ad28b35-bab2-47d3-a96e-b9758d94c614 · outbound

This paper cites 2021 , howpublished =.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , howpublished =

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:07.278414Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:07.278414Z digest=sha256:7b07cc9f6d26bc6850b7de87d58706f66f77eedea0d49d46e02c67c9e679828c

Observation e37ec71f-ade4-46eb-8efc-d89a0023d08f · outbound

This paper cites Empirical Software Engineering , volume=.

PROBE: Benchmarking Code Generation in Large Language Models Empirical Software Engineering , volume=

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:07.452672Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:07.452672Z digest=sha256:f5defa171f630c963d068da1ce851dfc104b83a3f489cd913b64c09bf9880485

Observation 69407b16-ed76-4352-98df-340f2499e617 · outbound

This paper cites Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval , pages =.

PROBE: Benchmarking Code Generation in Large Language Models Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval , pages =

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:07.666893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:07.666893Z digest=sha256:e36c8fc2ef34e3c196b7f4d596b8f2da7629ecc08c77fa7a95f3d0bf7f3bbf93

Observation d60e3f7d-e07a-4d3b-837e-f5e9fa85aa1e · outbound

This paper cites 2025 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2025 , eprint=

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:07.920990Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:07.920990Z digest=sha256:4749b4275549beb0e4c1b37d40be83fc96d22cf20046f5440dc53a2e84780fad

Observation a0eee248-7769-4830-b340-f57da7e2c468 · outbound

This paper cites ToolQA: A Dataset for LLM Question Answering with External Tools , url =.

PROBE: Benchmarking Code Generation in Large Language Models ToolQA: A Dataset for LLM Question Answering with External Tools , url =

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:08.032344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:08.032344Z digest=sha256:d15917da3b4ac6c34244d0f33b4d51353f4787b9a61ca6f64b14fd111853ac27

Observation 8ee1e01c-d416-474a-8eed-95e9839d8040 · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:08.194423Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:08.194423Z digest=sha256:732039610a268242a89ba9cd43a41defcae08914ac371c6eef9f24444ebac55d

Observation f36c1a84-4bb8-40e1-b9bd-89e80020aeab · outbound

This paper cites 2024 , publisher=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , publisher=

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:08.365693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:08.365693Z digest=sha256:45b4fdc652731d7e4a913e1bdb2d85b6ac4d681515799c3730c6986cb4a63634

Observation 51cd0afb-c0df-48d3-8770-e7dc51a85d4a · outbound

This paper cites Journal of Systems and Software , volume=.

PROBE: Benchmarking Code Generation in Large Language Models Journal of Systems and Software , volume=

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:08.536430Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:08.536430Z digest=sha256:04b86201efc298dbb596fab71abb25f3df7c1df23ea056bd62192316cb77af9f

Pith citing papers

Observation 0f48bb42-a000-4a5c-a932-9d11f02dcaab · inbound

Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code cites this paper.

Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code PROBE: Benchmarking Code Generation in Large Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-04T01:05:44.021875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T01:05:44.021875Z digest=sha256:51840db21111ecf5c54128aa5be5fbb57a51121643df1720d5ea86f5b4344a38