Pith. sign in

Paper Citation Record · LEDGER

NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness

As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2401.15963.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2401.15963 v3

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 11 of 11 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 11 of 11 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-08T16:31:38.639436Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

1
pith, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 52e42249-8522-42c0-84e7-636fc48c53f9 · inbound

LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code cites this paper.

LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness

Reference 233

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T17:34:42.850478Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-05-10T17:34:42.565806Z digest=sha256:e0a2dc2c8b0dc92adbc97845d10748301a8b67f9ede632f8e5e92a2fc032027c

Observation 712d1f2d-f67c-4ef0-9661-92e09ac45324 · inbound

Can LLMs Replace Human Evaluators? An Empirical Study of LLM-as-a-Judge in Software Engineering cites this paper.

Can LLMs Replace Human Evaluators? An Empirical Study of LLM-as-a-Judge in Software Engineering NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-08T16:31:38.639436Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T16:31:38.639436Z digest=sha256:cda05ae5883aa28f40814dcd543f42d687e1d0b5d7d8727dc0f899d0eb2d371d

Observation fca45593-bcae-41b4-af70-0a730633bf8d · inbound

SWE-IF: Aligning Code Evaluation with Human Preference cites this paper.

SWE-IF: Aligning Code Evaluation with Human Preference NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-04T11:02:09.872963Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T11:02:09.872963Z digest=sha256:31a3ab48ae7c5adaaaf38ac1f0300e3447bc3cb94886607908b380c3ac425aca

Observation dd02e5f8-bd74-4e57-9559-d58dd8b775a2 · inbound

Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents cites this paper.

Beyond Task Completion: A Verification-vs.-Conformance Gap in Tool-Evolving Agents NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-13T15:09:29.436835Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T15:09:29.436835Z digest=sha256:c293b0d7ee63429288b774151f90d4daf79448e3c866c0fadd4a5260556be895

Observation fbc72b37-e6de-48cd-82b3-63970d11120f · inbound

Precise Debugging Benchmark: Is Your Model Debugging or Regenerating? cites this paper.

Precise Debugging Benchmark: Is Your Model Debugging or Regenerating? NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-10T06:06:18.483526Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-10T06:05:32.866387Z digest=sha256:aaffaf23151ee67e3d9d4b93ef23cf407ad45ff30975c3726fdcefd633504973

Observation 7a05add4-dc20-4d07-95d7-59f4bf57688b · inbound

Precise Debugging Benchmark: Is Your Model Debugging or Regenerating? cites this paper.

Precise Debugging Benchmark: Is Your Model Debugging or Regenerating? NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-21T00:03:51.810133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-21T00:02:09.490384Z digest=sha256:fd9cb6696c6053a5b9b5ab0385bbbebf29f8eb8f39aa391e964d15c36dea64d9

Observation c578fd44-7dd6-4e55-bd41-f5397d1e153b · inbound

Reward-Free Code Alignment from Pretrained or Fine-Tuned LLM: Unpacking the Trade-offs for Code Generation cites this paper.

Reward-Free Code Alignment from Pretrained or Fine-Tuned LLM: Unpacking the Trade-offs for Code Generation NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness

Reference 45

Resolution
verified exact
arxiv_id, observed 2026-06-30T08:34:26.697407Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-06-30T08:30:37.016856Z digest=sha256:3cb48f047ed277a142efc25888877eb0383013b36fd520c18e9c547cec40a36a

Observation a625acd3-a4e3-4d8a-8cf4-3062e397a47d · inbound

JETO-Bench: A Reproducible Benchmark for Execution Time Improvement Patches in Java cites this paper.

JETO-Bench: A Reproducible Benchmark for Execution Time Improvement Patches in Java NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-07-01T11:35:43.681435Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-07-01T04:12:02.043499Z digest=sha256:9ad23c9863c739544b6e73f332f06cd98b25b05d182359ea8459ba4eb2eb8fdb

Observation 8bf8cd64-d90a-4000-84e1-73c2ad98c973 · inbound

JETO-Bench: A Reproducible Benchmark for Execution Time Improvement Patches in Java cites this paper.

JETO-Bench: A Reproducible Benchmark for Execution Time Improvement Patches in Java NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-02T09:24:35.728901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T09:24:35.728901Z digest=sha256:5da9fed01f847dcaf8eb3cc686bb82ddc33f6fd7feb5f6fd8722303c9d359d08

Observation 6f251ed2-c4c3-4a5f-ace8-0d11013bde83 · inbound

Rethinking Code Performance Benchmarks for LLMs cites this paper.

Rethinking Code Performance Benchmarks for LLMs NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness

Reference 36

Resolution
verified exact
local_arxiv, observed 2026-07-09T05:26:01.002164Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=arxiv_source observed=2026-07-09T05:16:58.549058Z digest=sha256:8b44bb01bc2e7783726e46d74151d65dbc8a1e99cbd9e95022c7f35ff5875c73

Observation 4d1c1588-cc5f-49b7-91ba-8b66f72e7594 · inbound

SynH-Rank: Quality-Aware Code Search via Diverse Data Synthesis and Hierarchical Ranking Training cites this paper.

SynH-Rank: Quality-Aware Code Search via Diverse Data Synthesis and Hierarchical Ranking Training NoFunEval: Funny How Code LMs Falter on Requirements Beyond Functional Correctness

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-01T18:57:45.213964Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T18:57:45.213964Z digest=sha256:53db786c67fb6724c0f38fd6030c1ac0ff97b2071b2a2a9d111f487364ca4276