Pith. sign in

Paper Citation Record · LEDGER

PROBE: Benchmarking Code Generation in Large Language Models

As of 9 August 2026, this Paper Citation Record lists 97 of 97 outbound references and 1 inbound Pith citation observation for arXiv:2607.13820.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.13820 v1

Coverage vector

measured 97 of 97 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-02T03:41:08.536430Z

measured 98 of 98 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-04T01:05:44.021875Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

97 of 97 outbound references displayed

  • verified exact1
  • verified fuzzy0
  • unresolved96
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation a410a632-1763-4eae-b526-daed9a6618b6 · outbound

This paper cites an unresolved cited work.

PROBE: Benchmarking Code Generation in Large Language Models Unresolved cited work

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.041633Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.041633Z digest=sha256:e7669f1268ed063ed60cfb88294e688c0aa2aecd2e2f817a932134caa980e8d4

Observation 46f6024f-dc71-42bb-9e7d-8536f2e661b7 · outbound

This paper cites , title =.

PROBE: Benchmarking Code Generation in Large Language Models , title =

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.077840Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.077840Z digest=sha256:99dba05d4e6b002daa8ba27f327bc3afda7526c6b27dfc7e9b30d7fbc5c9abfd

Observation 5555c998-53eb-458d-a936-7eccee424179 · outbound

This paper cites , title =.

PROBE: Benchmarking Code Generation in Large Language Models , title =

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.127050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.127050Z digest=sha256:c238fce79455aef1e9778db4e97008fa910402e5d16fc0f9dd97562c133049b6

Observation 04b2ea7e-5742-4ea3-8061-20c2378e1832 · outbound

This paper cites an unresolved cited work.

PROBE: Benchmarking Code Generation in Large Language Models Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.187776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.187776Z digest=sha256:b68add1dba01d44fea5ccc887c4f286bd6c6180eef4d8cc3ff1416af239b8fd4

Observation ca44938c-c300-45e0-baed-3f7865d2123a · outbound

This paper cites 2021 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , eprint=

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.240390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.240390Z digest=sha256:3fc9cf69ad4a24a0e256edf038fe91fa302cd4850e05aefba14f5b57b34aff2b

Observation db678837-a4c4-4847-947b-1c4be834457f · outbound

This paper cites Alice and Rice, Andrew and Rifkin, Devon and Simister, Shawn and Sittampalam, Ganesh and Aftandilian, Edward , title =.

PROBE: Benchmarking Code Generation in Large Language Models Alice and Rice, Andrew and Rifkin, Devon and Simister, Shawn and Sittampalam, Ganesh and Aftandilian, Edward , title =

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.328176Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.328176Z digest=sha256:96a0381b09130fdad4f1f3b95138bd09d5538440394d90769ff275d980e5a469

Observation b8194cc0-d9d1-4ecd-8966-eb885e5e2480 · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.428297Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.428297Z digest=sha256:6954a94d1fd93f73b905f93bc15e30ca826bf1246915428f55dfb12b5492cc0b

Observation 481876de-ea26-4800-8cc8-012518bb2298 · outbound

This paper cites Qwen2.5 Technical Report.

PROBE: Benchmarking Code Generation in Large Language Models Qwen2.5 Technical Report

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.516100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.516100Z digest=sha256:5894e089d1ff42a006dda1da4ae4f0b8ae3719d7684013bd2778cf1dc490dfb9

Observation 56a8bc06-989c-4ddc-b604-4033f04747ee · outbound

This paper cites 2024 , publisher=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , publisher=

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.591302Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.591302Z digest=sha256:a207d7a293ea6c3cf6ebf462ef8d3cb60adffd4055f7284cb54e3b58845d69ed

Observation bc7dcfd6-2643-4eed-b818-f124e6e1eb63 · outbound

This paper cites Language Models are Few-Shot Learners , url =.

PROBE: Benchmarking Code Generation in Large Language Models Language Models are Few-Shot Learners , url =

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.681179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.681179Z digest=sha256:2e84aeefdd5619c5b5fe8099fa4c056411f0cf0cf949effafe078a3922361499

Observation b1d2a032-cfc3-4f04-a76a-bc1b15b2d774 · outbound

This paper cites 2021 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , eprint=

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.764700Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.764700Z digest=sha256:61257c3cf690a88fec580cd5789136b859b4a99314e099db38e23e331f2d01a3

Observation 34e701d1-0d7c-482a-a9e8-58ae65754832 · outbound

This paper cites 2021 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , eprint=

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.836997Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.836997Z digest=sha256:7d79ac4eb42be88ddf85fc501cf49dbd62e25480789f812f106270cb94876f6e

Observation 737ed91b-eb48-4f57-820f-35a99cf0d527 · outbound

This paper cites 2023 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2023 , eprint=

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.912370Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.912370Z digest=sha256:26465d27f9ccb5e503ff0e9e07c4944b88a016b170be6550f3d90f37c79be2fd

Observation c286d5d3-bd91-4dcf-ba30-de49db1c824d · outbound

This paper cites 2021 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , eprint=

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-02T03:40:59.994552Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:40:59.994552Z digest=sha256:7d393bf023d2cbaf13c160eeb61ac830ad06e262838862a914ed1388137e871d

Observation ab136e6a-125f-46b0-86a6-c37ca5c5311f · outbound

This paper cites Attention is All you Need , url =.

PROBE: Benchmarking Code Generation in Large Language Models Attention is All you Need , url =

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.032812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.032812Z digest=sha256:f65f304db5af2391498a13676d2141f6bac76da0cfc66302b8f56778056d77d0

Observation 0f4253f5-7891-434b-b9fe-eea90dcd8fdc · outbound

This paper cites Long Short-Term Memory.

PROBE: Benchmarking Code Generation in Large Language Models Long Short-Term Memory

Reference 16

Resolution
verified exact
doi, observed 2026-08-02T03:43:22.735297Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-08-02T03:41:00.083856Z digest=sha256:7468ed1fcdb3d4e471f850fd99e8ee61ece9c50e8e15d2e06acb72610c25620e

Observation e8829be0-b76f-406a-811d-5261067a277c · outbound

This paper cites an unresolved cited work.

PROBE: Benchmarking Code Generation in Large Language Models Unresolved cited work

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.142904Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.142904Z digest=sha256:e1ca3f31ee892f4364be259d368ef4f4c4f48306ae5a228e7d3c136d9fb488c5

Observation 5f7b12dd-6f89-4f12-9f6d-4a0a5ac213ac · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.197477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.197477Z digest=sha256:d8622b8a73e7ef76cbe2eac498f5b6be2c0a6bb4d055b92cb7969403f3cb537a

Observation 4b13adc5-9e79-44a0-a88e-5032b32c363e · outbound

This paper cites 2002 , publisher =.

PROBE: Benchmarking Code Generation in Large Language Models 2002 , publisher =

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.254344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.254344Z digest=sha256:0813ea2f7b5acd819dcc1601c7bcda5d5e13e00b22ee408c89775938c01a9333

Observation cef076cf-bbeb-417f-a1df-92be8bb7f835 · outbound

This paper cites Text summarization branches out , pages=.

PROBE: Benchmarking Code Generation in Large Language Models Text summarization branches out , pages=

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.340873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.340873Z digest=sha256:542a41fa768363df24f78b1e85090dfed74bad4b9d354598a29895c267eadaee

Observation 2543796d-21fe-43a7-bb3e-8c34101e8b3c · outbound

This paper cites Proceedings of the acl workshop on intrinsic and extrinsic evaluation measures for machine translation and/or summarization , pages=.

PROBE: Benchmarking Code Generation in Large Language Models Proceedings of the acl workshop on intrinsic and extrinsic evaluation measures for machine translation and/or summarization , pages=

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.403280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.403280Z digest=sha256:10f5a9c78f4c36b060e5dacb740cdb2ccec46c808d62bb855dff0e95c1e9ae14

Observation 527405ba-9a91-436e-846c-d94289d7ef8d · outbound

This paper cites 2020 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2020 , eprint=

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.462363Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.462363Z digest=sha256:82c540d0539945714d059c5d443f82325aacea110f0677cccbcfb8e36bd0af48

Observation 2bc85aca-64f6-414d-86b1-2419ec2fc1d0 · outbound

This paper cites 1992 , publisher=.

PROBE: Benchmarking Code Generation in Large Language Models 1992 , publisher=

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.535796Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.535796Z digest=sha256:88895ac60908179caa54b02898cd77654ce4900077d5fd83adc94ce82793b9e8

Observation 11f245cf-2c48-476d-a9ad-d23f72615d46 · outbound

This paper cites Synthesize, Execute and Debug: Learning to Repair for Neural Program Synthesis , url =.

PROBE: Benchmarking Code Generation in Large Language Models Synthesize, Execute and Debug: Learning to Repair for Neural Program Synthesis , url =

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.598390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.598390Z digest=sha256:02f165ad24f29a39f09d0bd99895bca15a6e454cc30f2d8ba7ac99a093847f9b

Observation 9ba4e8c5-9750-471e-b948-7261049bf8cc · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.682028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.682028Z digest=sha256:572fa28f87e243ac1f328b08f27f9e79255ab5e35567bd24479cea862f73685f

Observation df89dfc2-c769-4ba0-9626-0a7a2e75aaa0 · outbound

This paper cites 2023 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2023 , eprint=

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.751011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.751011Z digest=sha256:0fe5c09e75e056e51530d033725a8fbd4ec803f76ec991510230abf344300edf

Observation 957690fe-b84f-4000-ad60-393ca88e9371 · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.833125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.833125Z digest=sha256:1288377e172e48fad05b887742d3380ca7b1375909549ea18aeaaa787051c776

Observation bb6c933d-b19c-42cb-bdfa-d60bca05576b · outbound

This paper cites 2017 , volume =.

PROBE: Benchmarking Code Generation in Large Language Models 2017 , volume =

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.896613Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.896613Z digest=sha256:a4ac65f363ef56bbf78e533c62df74d20ae4d327f5e833a2edfe7f834cfef7f5

Observation 7a3fc547-5788-410d-a981-6dfcc876fe09 · outbound

This paper cites Predicting a Correct Program in Programming by Example.

PROBE: Benchmarking Code Generation in Large Language Models Predicting a Correct Program in Programming by Example

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:00.949870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:00.949870Z digest=sha256:3c292de0f3ae9165af0070a9fb9e6fccc841fad4276d59fe33a8d1a4ccc7229f

Observation d0cfd897-0205-4523-8c02-61ed823bd4c1 · outbound

This paper cites SPoC: Search-based Pseudocode to Code , url =.

PROBE: Benchmarking Code Generation in Large Language Models SPoC: Search-based Pseudocode to Code , url =

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.006976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.006976Z digest=sha256:e308227bd1682de2ad9893cd9fe6bc082989d6cf01b1a35fbc11ec2ac15feafa

Observation 4f7c1253-f23b-4c76-8a62-dad4aa3e61ae · outbound

This paper cites Neural Attribution for Semantic Bug-Localization in Student Programs , url =.

PROBE: Benchmarking Code Generation in Large Language Models Neural Attribution for Semantic Bug-Localization in Student Programs , url =

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.101322Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.101322Z digest=sha256:9f9746da5608a47fae761e42ac9517533988a68e582977acba6839bd2028bad7

Observation e7f33a20-97cd-4cd7-b250-1b049ce514a2 · outbound

This paper cites 2021 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , eprint=

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.162778Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.162778Z digest=sha256:e909e04413e28cb8316d0fb808d485da71b01662f0207e04a4c1b1a46a0b733c

Observation b57e87ba-a056-40b5-86b1-beeba0e1b69b · outbound

This paper cites Liu , title =.

PROBE: Benchmarking Code Generation in Large Language Models Liu , title =

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.232166Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.232166Z digest=sha256:9f886dbd743d1062be06bdb706efac2d02bcdf1f81a17d135f20ebfe8dddb545

Observation 040faf8b-a86b-492f-9022-c124e6de4d4f · outbound

This paper cites Distributed Representations of Words and Phrases and their Compositionality , url =.

PROBE: Benchmarking Code Generation in Large Language Models Distributed Representations of Words and Phrases and their Compositionality , url =

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.286929Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.286929Z digest=sha256:c8eb540d22421e201e44ad85b97ec774b65197ed578852e7c7dabfb46fd8a8cb

Observation b2ec3db1-d854-47de-9cd7-6919cdd8b47d · outbound

This paper cites Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP) , pages=.

PROBE: Benchmarking Code Generation in Large Language Models Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP) , pages=

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.377487Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.377487Z digest=sha256:f69eb4e7064fc83f42e537653ac0e1b5b044467867c55385b2dab01964fe4e9e

Observation 493145d8-bd80-4e8e-8ae1-32cbcfaf7242 · outbound

This paper cites and Fei-Fei, Li , title =.

PROBE: Benchmarking Code Generation in Large Language Models and Fei-Fei, Li , title =

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.424056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.424056Z digest=sha256:8c9a589d0b6fcd913f3ff070d7aad8dd559dd22b665678f8b481641834f0e4a1

Observation 31fc5312-2cc7-4b43-9667-843c3dc6e76f · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.474006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.474006Z digest=sha256:ef7cf069c6ae7ab89c7354ba23fe8bdb662ab6146128043d6a6ae4ef2e915a0b

Observation daf10398-a8ed-44b7-a6de-9a31f26315b4 · outbound

This paper cites 2019 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2019 , eprint=

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.522051Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.522051Z digest=sha256:e052e244e92282c4ab3023348b024129b216f7b4d25e79c2881cab761e4f08a3

Observation 563c8154-874e-47b5-ad18-dd3fec4f8107 · outbound

This paper cites 2021 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , eprint=

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.585939Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.585939Z digest=sha256:94075ab4b36d0a45ac5ad17ca9f278b2df6ed66931f9abc28bf08d96a908cd09

Observation 2468b25b-588c-4326-a3b9-8032da3bf6f4 · outbound

This paper cites OpenAI blog , volume=.

PROBE: Benchmarking Code Generation in Large Language Models OpenAI blog , volume=

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.639757Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.639757Z digest=sha256:429dc31f4bf749f933b52685b854df956fb717b4bfff5fde5c2d5215bc78940c

Observation 652c8d91-ed11-4f33-85fa-d18e4c36dfdf · outbound

This paper cites 2023 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2023 , eprint=

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.675781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.675781Z digest=sha256:7915ab01dbba33fa299d7bc90b841946d9f278d7ebd339e1b4081c333fa73061

Observation 932c8d21-35d5-41ac-bac5-cb0944d16ccc · outbound

This paper cites 2021 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , eprint=

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.718188Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.718188Z digest=sha256:a3b4788738718051a8696f22e45631b04e98d67011a95b769494cbff52831f6c

Observation a2f7f0e5-ae73-4fd4-b1a3-90c92128c65f · outbound

This paper cites Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages=.

PROBE: Benchmarking Code Generation in Large Language Models Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing , pages=

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.769383Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.769383Z digest=sha256:bb1e8ea41b1c98150523843347ee447b99d0bf969faa5cb78769c6e867f9cb22

Observation e6940600-7ed7-43d8-bca9-0c5d656ae65d · outbound

This paper cites 2021 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , eprint=

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.803262Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.803262Z digest=sha256:1eacd08b885b08422b84215c9505d7d3d0a790babbf84112e4d8b802dd275e0a

Observation dc5f6d40-fcae-4e47-b8ef-bf8447568779 · outbound

This paper cites 2022 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2022 , eprint=

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.871602Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.871602Z digest=sha256:4da97572cc6081764d6ee3f6a4c428ffead37a28ac9eed610ebb11ecd59d5808

Observation 50612aee-d8d4-49cf-a4f6-b19898bee443 · outbound

This paper cites , title =.

PROBE: Benchmarking Code Generation in Large Language Models , title =

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.924993Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.924993Z digest=sha256:bc22bb678e6c934ab77d126e4b72e1616dfd57f2ecffeb3e93a08eb37bdbf6a8

Observation 96776520-2829-4aac-8e21-a59e9828117e · outbound

This paper cites 2023 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2023 , eprint=

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:01.977621Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:01.977621Z digest=sha256:948bc7987c19cf95480a5bcf1a784f71f2bacce83f901735c2e5ab4190697f5a

Observation fcfae5a5-ebf1-4e7b-ad33-06f6bb59bbfc · outbound

This paper cites 2023 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2023 , eprint=

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.029969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.029969Z digest=sha256:12b10fa5d36ba701c7e68713e6f07085311a4bce6eaf1b21267f6e8b83a8f2bb

Observation d0708426-74c3-442a-bb29-d852c03f1b56 · outbound

This paper cites Right for the Wrong Reasons: Diagnosing Syntactic Heuristics in Natural Language Inference.

PROBE: Benchmarking Code Generation in Large Language Models Right for the Wrong Reasons: Diagnosing Syntactic Heuristics in Natural Language Inference

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.119264Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.119264Z digest=sha256:6bf5bbeec865d653c47fc16feff704a7aac817750917412910b3757808841f97

Observation c50e8c9f-9f79-4861-8750-e87aca657167 · outbound

This paper cites 2019 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2019 , eprint=

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.196404Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.196404Z digest=sha256:bbe45355a891468b35441917404427d1bb966220c0ca59b89d20d0ce007a9522

Observation 00153917-8540-4ace-ad5b-d0ab58743f6b · outbound

This paper cites 2022 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2022 , eprint=

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.276767Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.276767Z digest=sha256:363044ec1b3f5776a2bcc4ab470bdbc5a9ea081785f59ca68ca92a2a183fef34

Observation 8cdbf6bf-c228-48bb-9068-74f0e2fb4e12 · outbound

This paper cites 2023 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2023 , eprint=

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.328305Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.328305Z digest=sha256:36b8027b37b66d6d247f69080702f12949b6ad81e2401e2301be6700aa572e8e

Observation 77bc4aa6-e016-447c-9548-7885e188a949 · outbound

This paper cites 2020 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2020 , eprint=

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.435612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.435612Z digest=sha256:8e74cab553f8a2e2d5694419766c369b0258052a41597dcaad5ab085fc0f47c0

Observation f4eab490-835d-4dcf-a8ae-814740c7fdc1 · outbound

This paper cites 2023 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2023 , eprint=

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.486791Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.486791Z digest=sha256:4aeda82bb95e0ef2da62a246bd474623bdd3acad51e8ce0d610015b920b18736

Observation 1421c880-32d1-474a-ac36-7f6084a89b1d · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.489711Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.489711Z digest=sha256:7917da4549f17dc040f40b70e86b757b34a450fe02bf0c6f7b49a952d92cf177

Observation 49c2f4be-60da-4c7b-87cd-8254a55b813b · outbound

This paper cites Training language models to follow instructions with human feedback , url =.

PROBE: Benchmarking Code Generation in Large Language Models Training language models to follow instructions with human feedback , url =

Reference 56

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.555293Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.555293Z digest=sha256:538bee726ec34bf324c90474c7905f656a47d11991558ff1f5544b8d5fa9a90c

Observation bd143f87-cee7-4d53-b105-b3510a51e39d · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.693353Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.693353Z digest=sha256:3f0df92822861cdfac8218d69157518bce0506049fd96af3ba76d3976ab1a707

Observation 0cdc6d04-4602-4cbe-9183-6aa0d4f67aba · outbound

This paper cites 2023 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2023 , eprint=

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.855468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.855468Z digest=sha256:a86d148dc5b229a7124bf3a397228dd38cf92813fca603ba7d77075b331ab588

Observation fc2a8aa5-5343-4316-9cc9-3159358ed8aa · outbound

This paper cites HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models.

PROBE: Benchmarking Code Generation in Large Language Models HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:02.990486Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:02.990486Z digest=sha256:7a29a2dfa09b580302fef2c2548c4d8021a79f2658c589160e018746e83962e2

Observation 0cedbebf-9d83-4555-9b52-d2d936a808d5 · outbound

This paper cites Advances in neural information processing systems , volume=.

PROBE: Benchmarking Code Generation in Large Language Models Advances in neural information processing systems , volume=

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.113431Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.113431Z digest=sha256:d12756b43c8c710c9a692eefd79f72981ce7d3e57df702f724738d014678d41d

Observation e145c4ee-625c-401d-8199-49cc5785808a · outbound

This paper cites Proceedings 2003 VLDB Conference , pages=.

PROBE: Benchmarking Code Generation in Large Language Models Proceedings 2003 VLDB Conference , pages=

Reference 61

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.187782Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.187782Z digest=sha256:c3dfb9b9cbf7b92e0e07358e844f4982878364b90f0824f4162bfdc2c783e5ee

Observation f10755b6-7956-4da4-9cfb-391268150286 · outbound

This paper cites 2021 , publisher =.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , publisher =

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.310408Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.310408Z digest=sha256:891d84fa875b2040f4439bfb92003cc694c31d355afef28c8a5b18f718febb80

Observation df0dfbb5-133d-40d1-8560-6176b9010b83 · outbound

This paper cites an unresolved cited work.

PROBE: Benchmarking Code Generation in Large Language Models Unresolved cited work

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.430829Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.430829Z digest=sha256:a772191fc7d1947803bc74e9c4254702dd58ca3218456666a585a50c8065673a

Observation 7a7ba2e0-ce04-4245-875e-29e24b32a7e0 · outbound

This paper cites Mapping Language to Code in Programmatic Context.

PROBE: Benchmarking Code Generation in Large Language Models Mapping Language to Code in Programmatic Context

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.553027Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.553027Z digest=sha256:5f714cc192a4f5735e484d9dbc000f327b42c3a9a970e50b3a0010adc2564d97

Observation e9b2af0c-f4eb-4659-8862-7a2d63f61952 · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.670850Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.670850Z digest=sha256:1ce0a49a464969b9a2bc5c23801c72260c72d3c35c82e21ab185b024dbcbb096

Observation 1d9daa2e-6d8a-459d-b00e-f3f679847326 · outbound

This paper cites 2022 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2022 , eprint=

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.792906Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.792906Z digest=sha256:a0843c44dcb0d01ba30d36f1cdab126c75beb828c730f1b8ef3dc87c1ed6b187

Observation 485e5059-decb-40fe-9846-dd5874deaa3b · outbound

This paper cites 2022 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2022 , eprint=

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.873151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.873151Z digest=sha256:b887ad58ac88380d50ee8be56234bf1377b8b9fba1e6844e4056bc80555843a7

Observation c0bba666-ab21-4e44-866a-0539991f3d35 · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:03.997658Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:03.997658Z digest=sha256:c094b93f81e81850824d18faec8c624cc18006ba91d7e6e15413140f377ae9ef

Observation a5989be4-e0d2-47cf-8527-6545042c4728 · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:04.116893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:04.116893Z digest=sha256:ce7e93d8c4fcf5086427ea6b6c0146ea3c0c5077628df68fbcb8c0395b9fa595

Observation 0ef7664c-32b3-40ae-9415-9e80a88179af · outbound

This paper cites International conference on machine learning , pages=.

PROBE: Benchmarking Code Generation in Large Language Models International conference on machine learning , pages=

Reference 70

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:04.236798Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:04.236798Z digest=sha256:0364eacb1496a5f338062e43f3655346c282d91389355c45067186ef5abccb45

Observation 4370a0a0-4ad2-4be9-b247-33a7b29c51c6 · outbound

This paper cites Distilling Knowledge from Reader to Retriever for Question Answering.

PROBE: Benchmarking Code Generation in Large Language Models Distilling Knowledge from Reader to Retriever for Question Answering

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:04.355532Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:04.355532Z digest=sha256:0c8d0e50d49fffebd714bfbaffbe675e7c19ec62cfc3a72c205d7957f630c87f

Observation 46c049ac-8041-4a70-b333-fc67f9a7f2de · outbound

This paper cites Let's Verify Step by Step.

PROBE: Benchmarking Code Generation in Large Language Models Let's Verify Step by Step

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:04.479139Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:04.479139Z digest=sha256:18a3bbb7a5b448d6aba20436e06a2c59b1465b474541c8802f92906283828cc5

Observation 39316138-77e0-4488-9ed2-8989be2131aa · outbound

This paper cites Generating Natural Language Proofs with Verifier-Guided Search.

PROBE: Benchmarking Code Generation in Large Language Models Generating Natural Language Proofs with Verifier-Guided Search

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:04.562180Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:04.562180Z digest=sha256:a1a8ea39ea1c69bdb3490697743f5585bea5480356d3da6d1b281ab5b15cc8cb

Observation b91aafdb-bc61-4327-91df-217fb0944e1d · outbound

This paper cites StarCoder: may the source be with you!.

PROBE: Benchmarking Code Generation in Large Language Models StarCoder: may the source be with you!

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:04.657260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:04.657260Z digest=sha256:90bdad844780e23f0469b8c0daa1bb860d37aa94e3d4965cf2637d967af1ac8f

Observation fba60d61-8335-44a9-becd-1728c132b945 · outbound

This paper cites Annotation Artifacts in Natural Language Inference Data.

PROBE: Benchmarking Code Generation in Large Language Models Annotation Artifacts in Natural Language Inference Data

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:04.739473Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:04.739473Z digest=sha256:3793a7018afcc4780b73d3894fbb02582ed68b1b74426e6ec46e5a4cd25f3785

Observation 7e65b358-3a1f-4f0f-b8ae-b5d39fada2a7 · outbound

This paper cites Non-Determinism of "Deterministic" LLM Settings.

PROBE: Benchmarking Code Generation in Large Language Models Non-Determinism of "Deterministic" LLM Settings

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:04.881119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:04.881119Z digest=sha256:6063591fac64e6c8929571299d0c03bbfed69eba2fd7794c22d6a5f5fc440407

Observation c1899611-320c-41f7-9c33-ebae04e3f7ce · outbound

This paper cites Large Language Models are Zero-Shot Reasoners , url =.

PROBE: Benchmarking Code Generation in Large Language Models Large Language Models are Zero-Shot Reasoners , url =

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:05.042606Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:05.042606Z digest=sha256:e078b5b55211412d2be17931472848b2baa854cd8f6308c142ef996c2288d93c

Observation dbd2cbc5-ae6f-4ab3-8bab-0d48cb393f64 · outbound

This paper cites Density-Based Clustering in Spatial Databases: The Algorithm GDBSCAN and Its Applications , journal =.

PROBE: Benchmarking Code Generation in Large Language Models Density-Based Clustering in Spatial Databases: The Algorithm GDBSCAN and Its Applications , journal =

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:05.143110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:05.143110Z digest=sha256:2a7023ef657126463d894aaee5cd2a3223d3b74faa2e21586229cef3587364e5

Observation 747fa17c-127d-4c4e-a779-9cd649416b2a · outbound

This paper cites A Survey on Mixture of Experts in Large Language Models.

PROBE: Benchmarking Code Generation in Large Language Models A Survey on Mixture of Experts in Large Language Models

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:05.245748Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:05.245748Z digest=sha256:9eaf15dfdece6e80d943245018b99d19b79260ef47f4a7a08ada679a6e1e4e83

Observation e168f7ef-749e-474a-b1b4-521536b62bc4 · outbound

This paper cites Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer.

PROBE: Benchmarking Code Generation in Large Language Models Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:05.393633Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:05.393633Z digest=sha256:7033404d54ad4b26d20d643c991157127d47cdaf8571b9bbd2d1e745e3cc5edf

Observation 4a630a48-8142-4033-9285-d8cd0de50098 · outbound

This paper cites Journal of Machine Learning Research , volume=.

PROBE: Benchmarking Code Generation in Large Language Models Journal of Machine Learning Research , volume=

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:05.619368Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:05.619368Z digest=sha256:af8221704c87c5ad1d7bb2a45c95ff40d733dde026a648663e2bc52354571ce3

Observation 42a60d18-10d9-41e5-b4f0-24799f274b3b · outbound

This paper cites DeepSeek-V3 Technical Report.

PROBE: Benchmarking Code Generation in Large Language Models DeepSeek-V3 Technical Report

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:05.769361Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:05.769361Z digest=sha256:20757a690270ec39cbfeba3a96cca5e2894bedf81d8442cce7f7048d1595ec24

Observation 769737aa-f3e4-413d-9705-1ceb5af6b6c1 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

PROBE: Benchmarking Code Generation in Large Language Models DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:05.979493Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:05.979493Z digest=sha256:a1a5c2db0b660c38703557ff8a4174d8169107cff10f5800993db63db1c3ef8e

Observation 2358ba9e-178d-4abc-a77b-bc30fbaf5b3d · outbound

This paper cites Journal of medical Internet research , volume=.

PROBE: Benchmarking Code Generation in Large Language Models Journal of medical Internet research , volume=

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:06.143522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:06.143522Z digest=sha256:3048e0438321df51a743740bf57b01baca7e170cc60c31fc31b14cb744c6ff96

Observation b71dbb2c-c9f4-4dac-a76b-c9a7de4fbbf6 · outbound

This paper cites AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts.

PROBE: Benchmarking Code Generation in Large Language Models AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:06.319054Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:06.319054Z digest=sha256:a9281b1a2cfa11a9d9bcb769c03a5a3ac3cbd08c012c53ce6d99fd8ac38b0bcd

Observation 1ac0563e-4fa9-4ef9-be9e-8daf2fca9e16 · outbound

This paper cites The Prompt Report: A Systematic Survey of Prompt Engineering Techniques.

PROBE: Benchmarking Code Generation in Large Language Models The Prompt Report: A Systematic Survey of Prompt Engineering Techniques

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:06.532907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:06.532907Z digest=sha256:db3be4c942613042c11ced924887d28b16354d0d2ec7e33cff914e14f8975731

Observation fcaac1ac-3bfd-4fa4-bdd8-21277b31af47 · outbound

This paper cites DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence.

PROBE: Benchmarking Code Generation in Large Language Models DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:06.722239Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:06.722239Z digest=sha256:2856e9f8cbe7bef2dff19ea37bb2ee1bc1851fcf8e0c00183d975fd4096161ce

Observation 6358adc9-4ed3-470e-bc4b-ae51a0f6c75f · outbound

This paper cites 2022 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2022 , eprint=

Reference 88

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:06.967903Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:06.967903Z digest=sha256:f2ec2fe6709e4f42ed5c8c15ab07eae05c30d8bda38bf37240d67bd40ff79b52

Observation 1560eeaa-801d-4787-91b3-738f50d41df5 · outbound

This paper cites 2022 , howpublished =.

PROBE: Benchmarking Code Generation in Large Language Models 2022 , howpublished =

Reference 89

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:07.110645Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:07.110645Z digest=sha256:05d953b1a0a02e976c2285c8cc1b1f1d0bd2ddff8cc2768bb5dabd19d1d17116

Observation 5ad28b35-bab2-47d3-a96e-b9758d94c614 · outbound

This paper cites 2021 , howpublished =.

PROBE: Benchmarking Code Generation in Large Language Models 2021 , howpublished =

Reference 90

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:07.278414Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:07.278414Z digest=sha256:0165080947e90cd9f1fa46367a4e55dd07d34f68c2e687f0245b36e358e8596d

Observation e37ec71f-ade4-46eb-8efc-d89a0023d08f · outbound

This paper cites Empirical Software Engineering , volume=.

PROBE: Benchmarking Code Generation in Large Language Models Empirical Software Engineering , volume=

Reference 91

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:07.452672Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:07.452672Z digest=sha256:ee301fa93a12764a6017cb856271152b7a5122427a4bbe7d5374195bde9090b5

Observation 69407b16-ed76-4352-98df-340f2499e617 · outbound

This paper cites Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval , pages =.

PROBE: Benchmarking Code Generation in Large Language Models Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval , pages =

Reference 92

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:07.666893Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:07.666893Z digest=sha256:751917830ce154ac4f21c5777d81499d0d2d5134375a82030c37362b40685a68

Observation d60e3f7d-e07a-4d3b-837e-f5e9fa85aa1e · outbound

This paper cites 2025 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2025 , eprint=

Reference 93

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:07.920990Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:07.920990Z digest=sha256:f8aeb9389a21bbcc03b6836c39a075ae4e3a6903cd53bd92ef6f6850ee1f3f7e

Observation a0eee248-7769-4830-b340-f57da7e2c468 · outbound

This paper cites ToolQA: A Dataset for LLM Question Answering with External Tools , url =.

PROBE: Benchmarking Code Generation in Large Language Models ToolQA: A Dataset for LLM Question Answering with External Tools , url =

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:08.032344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:08.032344Z digest=sha256:8b30b0ca01bae0478165ee91a30705e04795ca9ecd52603738e543da85c73dd1

Observation 8ee1e01c-d416-474a-8eed-95e9839d8040 · outbound

This paper cites 2024 , eprint=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , eprint=

Reference 95

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:08.194423Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:08.194423Z digest=sha256:f5203d6fd23c007cf2d5818da7fec45454cb499d236b79854dfb84a5b2294eca

Observation f36c1a84-4bb8-40e1-b9bd-89e80020aeab · outbound

This paper cites 2024 , publisher=.

PROBE: Benchmarking Code Generation in Large Language Models 2024 , publisher=

Reference 96

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:08.365693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:08.365693Z digest=sha256:d3075da9c1999d4bbd3590482cf182cd0fd4418b133bc734f7befbf91d5262a1

Observation 51cd0afb-c0df-48d3-8770-e7dc51a85d4a · outbound

This paper cites Journal of Systems and Software , volume=.

PROBE: Benchmarking Code Generation in Large Language Models Journal of Systems and Software , volume=

Reference 97

Resolution
unresolved
no resolver link, observed 2026-08-02T03:41:08.536430Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T03:41:08.536430Z digest=sha256:899e4d1c7ae0b8ef9c3b32923fcfdcbb674882d722f709523e8200bbd9ff68fb

Pith citing papers

Observation 0f48bb42-a000-4a5c-a932-9d11f02dcaab · inbound

Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code cites this paper.

Unreliable in Practice? A Comprehensive Study of Errors in LLM-Generated Code PROBE: Benchmarking Code Generation in Large Language Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-04T01:05:44.021875Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T01:05:44.021875Z digest=sha256:5d5e182e2abd345a658ebb6a6fa389a4f5a5f0dbeaaf7937b992bbb2208c769a