Pith. sign in

Paper Citation Record · LEDGER

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation

As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2505.24324.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.24324 v1

Coverage vector

measured 31 of 31 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T12:29:19.342174Z

measured 31 of 31 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

31 of 31 outbound references displayed

  • verified exact3
  • verified fuzzy11
  • unresolved17
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation beea5b85-87fa-4e8f-af78-6c00c5c3b812 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Evaluating Large Language Models Trained on Code

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:16.723342Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:16.723342Z digest=sha256:227393467e03a70ac77b55a9a1e719e27cb0a14a6134755d1bb46cb3e651920f

Observation fdfd9c76-f6c0-43a0-b88d-7513e345f0ed · outbound

This paper cites CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:24.765437Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:29:16.771938Z digest=sha256:d9b8555dc6070738a63691ef2ddb18d3ec94aaa750d1776590f9b178358b34dd

Observation a7abdd35-4b4e-412e-b899-3b8573467071 · outbound

This paper cites A Systematic Evaluation of Large Language Models of Code.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation A Systematic Evaluation of Large Language Models of Code

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:16.864754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:16.864754Z digest=sha256:e5cfd84d84afd78b16ae765e0e07ea6be12550dcccc7d05cced83072801a1803

Observation c225c370-6ffa-4b0f-ac48-1692011462c6 · outbound

This paper cites DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.012603Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.012603Z digest=sha256:c9764a64d586d2bc33b8d8f2e7c5db73dc01c6e28d8426a079e376444dc0c3ea

Observation 179b10cf-8abc-4b9c-b004-bbf94ff66f0c · outbound

This paper cites Code Llama: Open Foundation Models for Code,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Code Llama: Open Foundation Models for Code,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:24.516278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:29:17.072363Z digest=sha256:48c9f456904c07707fbc3071eb83338e843a30c3297e48735fd123e5a0025625

Observation e80f189a-dbe1-49ed-aeab-78742db7615c · outbound

This paper cites Code Completion by Modeling Flattened Abstract Syntax Trees as Graphs,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Code Completion by Modeling Flattened Abstract Syntax Trees as Graphs,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:24.238411Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:29:17.100223Z digest=sha256:e40e4b35cbf88f97804636a618e4a7c6ec4a4005622dd2b1e1b68d9769f0d1db

Observation 993299aa-b9fc-4646-bcbb-4c01309223e5 · outbound

This paper cites Lost in Translation: A Study of Bugs Introduced by Large Language Models while Translating Code,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Lost in Translation: A Study of Bugs Introduced by Large Language Models while Translating Code,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:24.005177Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:29:17.154474Z digest=sha256:ece386306ed94a8480fad19fb56c679926f2fe2028a51cb3a020350ded28648f

Observation f2b866d3-1975-437f-bd25-af74eacae51b · outbound

This paper cites Few-shot training LLMs for project-specific code-summarization.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Few-shot training LLMs for project-specific code-summarization

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-08-07T12:29:21.221743Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:29:17.205650Z digest=sha256:48add14dfa1cd44b4b753c0665f3e488e36c2fe47c6fc4e36b17e59415cda1c3

Observation 187c8295-2312-4503-9d86-e9a619655250 · outbound

This paper cites Program Synthesis with Large Language Models.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Program Synthesis with Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.258721Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.258721Z digest=sha256:ae0312ea3bfe53d62f6ff0e466365ea609f02c29d7837c6605f87da6cd6b8688

Observation 1ee8ea2e-ba01-48dd-b29d-1ce5a23110e6 · outbound

This paper cites Multi-lingual Evaluation of Code Generation Models,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Multi-lingual Evaluation of Code Generation Models,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:23.771090Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:29:17.357832Z digest=sha256:7ad4b6753519326988bf3c72dc163578f0287141523976905249f8fe3418f6bd

Observation 4e8e84b3-d10f-49f2-b574-4d8f8eaf4e04 · outbound

This paper cites Large Language Models Meet NL2Code: A Survey.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Large Language Models Meet NL2Code: A Survey

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.440179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.440179Z digest=sha256:4661146b6453dc51846c7bf5b1a7804f8fb5a6ee463fa73925505298e0124f11

Observation ba0c226f-54b7-4ea7-9d9a-fd90facb5e6b · outbound

This paper cites Measuring Coding Challenge Competence With APPS.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Measuring Coding Challenge Competence With APPS

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.540016Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.540016Z digest=sha256:031c96aee08024c06b86623737c621fc413c181a760e4c7a789037301098943c

Observation fcc5be15-61c6-4ab8-9267-2194bece6ba9 · outbound

This paper cites CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.628104Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.628104Z digest=sha256:e4eadf8f9f9b3c31a8c90520c66792afb91c4a21dd282996aa23fa23f5206f3c

Observation b966ab95-d45a-4334-a0b9-ba15c86ccff5 · outbound

This paper cites MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:23.566218Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:29:17.720704Z digest=sha256:0ba88c819c627d53d82ff73ee191058be9d6e925dac940e4bcebba24b336d8ff

Observation 08259e35-cb6d-4722-9b32-b986b9a79b8e · outbound

This paper cites HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.936773Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.936773Z digest=sha256:c77cbbbb425ba178c0feac358a710b21d521715e3e1d7830aed9c9c86df6228e

Observation 28ff50ae-dac9-4b29-ad6e-4aa66b623c37 · outbound

This paper cites The RedMonk Programming Language Rankings: June 2024,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation The RedMonk Programming Language Rankings: June 2024,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:23.204754Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:29:18.074472Z digest=sha256:b50c2ec4bb2d5caf98177b55eac67be49bf8ff2bbb9f371d9b10e2695b7f51ce

Observation 17e14ba7-40c0-475d-9163-b51da64b5e20 · outbound

This paper cites BLEU: a method for automatic evaluation of machine translation,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation BLEU: a method for automatic evaluation of machine translation,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:22.910899Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:29:18.185855Z digest=sha256:0f53d0494c370b1c0edd93b60074ed1a7f9bc53301ffca9ac362d7525befd848

Observation 889cb942-2ff9-4f1b-844a-d6d684838f2d · outbound

This paper cites CodeBLEU: a Method for Automatic Evaluation of Code Synthesis.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation CodeBLEU: a Method for Automatic Evaluation of Code Synthesis

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:18.364837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:18.364837Z digest=sha256:e44edec16b8012a270b952f92b49183655e0f44fabd1cc944b6e761f1b3a54db

Observation fb1ad3e0-5e03-4ab1-aeff-d7c4f5f9f56d · outbound

This paper cites Rethinking Benchmark and Contamination for Language Models with Rephrased Samples.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Rethinking Benchmark and Contamination for Language Models with Rephrased Samples

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:18.525978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:18.525978Z digest=sha256:db657f9b4aa08e7e0cec99a9854332dab146b11a1bc975ec6f9e12db939524a7

Observation e5e5128d-a80f-418b-8437-e1711082ceea · outbound

This paper cites DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:18.701253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:18.701253Z digest=sha256:16f885681d5bf6b051874cc9bbc2b310a1969796346fd121f60be334764d563f

Observation a067a680-2594-451c-a942-61d846b27d0d · outbound

This paper cites ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:18.835891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:18.835891Z digest=sha256:f973ea1ea94a2cb3d5e331f4ec4523fae39d075eaf91ca5f6f14911eced63f2e

Observation 0ed1519f-bcdd-4d7b-9da1-022f0af9d30a · outbound

This paper cites CrossCodeEval: A Diverse and Multilingual Benchmark for Cross-File Code Completion.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation CrossCodeEval: A Diverse and Multilingual Benchmark for Cross-File Code Completion

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:18.912346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:18.912346Z digest=sha256:44126330e3f762df0c6fa6817e15551d9a21bef6915663dae590a085b5cd99aa

Observation 3b067938-c473-46de-8d0b-3fae1dd81151 · outbound

This paper cites JavaBench: A Benchmark of Object-Oriented Code Generation for Evaluating Large Language Models.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation JavaBench: A Benchmark of Object-Oriented Code Generation for Evaluating Large Language Models

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-08-07T12:29:19.900313Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:29:18.981766Z digest=sha256:c3d56ec5a17ff8cb86aec78dd04cfde4031ff77fb9cb88017d1ab117578adbd1

Observation 420e91c7-9ceb-44a7-802d-b81cf01f07ec · outbound

This paper cites mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:19.036173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:19.036173Z digest=sha256:fa81f9c5360d4c8aba258b8b0dc267eab6983bb2edf31897d7702038bbb67bd5

Observation a4d59dc5-d10c-4dec-b44c-3c756e2311f8 · outbound

This paper cites DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:19.084876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:19.084876Z digest=sha256:29063ade1383e324f8b2c4109aeef71c6e240d1a4d15f5522918aa68d0ee816f

Observation 2e236130-4401-4941-b8b7-dd26f15a5daf · outbound

This paper cites Qwen2.5-Coder Technical Report.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Qwen2.5-Coder Technical Report

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:19.117475Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:19.117475Z digest=sha256:4ff525d05a4d987fb097398429f88fe61613fccaaa0abdba74d0303d21331882

Observation 50e71aca-cd44-43f1-b3e0-ee6ecb237f6e · outbound

This paper cites Codestral: Hello, World!,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Codestral: Hello, World!,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:22.594838Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:29:19.175383Z digest=sha256:a22ea13f0a6cb16b54c5d0505bb1e9b8c139101df3d173899c2f9be70b858236

Observation 1cb66ead-1dad-43e4-8f56-ea15961c4df8 · outbound

This paper cites CPP-UT-Bench: Can LLMs Write Complex Unit Tests in C++?.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation CPP-UT-Bench: Can LLMs Write Complex Unit Tests in C++?

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-08-07T12:29:19.561417Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:29:19.236375Z digest=sha256:58a239edc58f4a0227994f09b6860cda09f9cbd085a7cd080094116b0abdc6d5

Observation cc0aa898-2ecb-4237-9d8a-c5a1cccae062 · outbound

This paper cites HumanEval.jl,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation HumanEval.jl,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:22.214898Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:29:19.286705Z digest=sha256:038a114d98e0ed35e398178a969846cabd169aa479542a1136fb2602cf8f35d6

Observation 4fbff495-e80d-48c8-9c27-092512988089 · outbound

This paper cites Rust Compiling Benchmark,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Rust Compiling Benchmark,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:21.924760Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T12:29:19.342174Z digest=sha256:3d1e9659cc209c1a2646610046ea5b5ef22b2740dc0425fc70783f939f8dc37f

Observation 87e2efdb-0046-440d-9965-ce658358a6ec · outbound

This paper cites MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.854881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.854881Z digest=sha256:1ec32da550278487f695047827da49d6e59581db74837d29200f15c556517fd7

Pith citing papers

No inbound Pith citation observations are available.