Pith. sign in

Paper Citation Record · LEDGER

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation

As of 22 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2505.24324.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.24324 v1

Coverage vector

measured 31 of 31 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T12:29:19.342174Z

measured 31 of 31 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

31 of 31 outbound references displayed

  • verified exact3
  • verified fuzzy11
  • unresolved17
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation beea5b85-87fa-4e8f-af78-6c00c5c3b812 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Evaluating Large Language Models Trained on Code

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:16.723342Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:16.723342Z digest=sha256:c4b7bbc3b545151847f311b26959d52bc218eeccb0b684b0e46ccfe533847226

Observation fdfd9c76-f6c0-43a0-b88d-7513e345f0ed · outbound

This paper cites CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:24.765437Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T12:29:16.771938Z digest=sha256:ee70234e196c5c6fe0f9e86be7ae995c874431494fbc4138a52b5cc3dceb37b7

Observation a7abdd35-4b4e-412e-b899-3b8573467071 · outbound

This paper cites A Systematic Evaluation of Large Language Models of Code.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation A Systematic Evaluation of Large Language Models of Code

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:16.864754Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:16.864754Z digest=sha256:897b1af1bd799011816af57c140dd25b542953c6176f2ee42380bbfbaed53a79

Observation c225c370-6ffa-4b0f-ac48-1692011462c6 · outbound

This paper cites DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.012603Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.012603Z digest=sha256:394d11abc9f176395d4cdf9264cc0c1097dfb73c57deb02e70df1d5048308a90

Observation 179b10cf-8abc-4b9c-b004-bbf94ff66f0c · outbound

This paper cites Code Llama: Open Foundation Models for Code,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Code Llama: Open Foundation Models for Code,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:24.516278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T12:29:17.072363Z digest=sha256:a7f4ec26e428e10b12901e1b2a6223ffd7e2294b16ee42cddd1df0e2b2e56468

Observation e80f189a-dbe1-49ed-aeab-78742db7615c · outbound

This paper cites Code Completion by Modeling Flattened Abstract Syntax Trees as Graphs,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Code Completion by Modeling Flattened Abstract Syntax Trees as Graphs,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:24.238411Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T12:29:17.100223Z digest=sha256:3b57314cc53b7bde9d855a2efe7714d4433497fa13ad2702d71d33dd825c9243

Observation 993299aa-b9fc-4646-bcbb-4c01309223e5 · outbound

This paper cites Lost in Translation: A Study of Bugs Introduced by Large Language Models while Translating Code,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Lost in Translation: A Study of Bugs Introduced by Large Language Models while Translating Code,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:24.005177Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T12:29:17.154474Z digest=sha256:2fe1a3dabec5c6e44d6833228f75a89139696e0091617c69d5403598f1ed3fab

Observation f2b866d3-1975-437f-bd25-af74eacae51b · outbound

This paper cites Few-shot training LLMs for project-specific code-summarization.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Few-shot training LLMs for project-specific code-summarization

Reference 8

Resolution
verified exact
local_arxiv, observed 2026-08-07T12:29:21.221743Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T12:29:17.205650Z digest=sha256:880e950cf73a90babaa088a49a1557d5fdda06b65c82c2e0e506f754cb469136

Observation 187c8295-2312-4503-9d86-e9a619655250 · outbound

This paper cites Program Synthesis with Large Language Models.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Program Synthesis with Large Language Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.258721Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.258721Z digest=sha256:c844e2303cc5e70af71a81e7c7525cd0503dc742264bf775d17424eabc800e22

Observation 1ee8ea2e-ba01-48dd-b29d-1ce5a23110e6 · outbound

This paper cites Multi-lingual Evaluation of Code Generation Models,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Multi-lingual Evaluation of Code Generation Models,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:23.771090Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T12:29:17.357832Z digest=sha256:3629ee129cbe8f16d5c90305603510a745bd69f423a1af4249fb5c880db3f383

Observation 4e8e84b3-d10f-49f2-b574-4d8f8eaf4e04 · outbound

This paper cites Large Language Models Meet NL2Code: A Survey.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Large Language Models Meet NL2Code: A Survey

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.440179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.440179Z digest=sha256:a8d27340e586c0b0a3b5f56055852248777d6d67c6a861560c0c7ed9e9a64453

Observation ba0c226f-54b7-4ea7-9d9a-fd90facb5e6b · outbound

This paper cites Measuring Coding Challenge Competence With APPS.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Measuring Coding Challenge Competence With APPS

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.540016Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.540016Z digest=sha256:ecc314f8608dacec9f091409b8e2729f3b75c96dfcb647a6ceb14c39893e447c

Observation fcc5be15-61c6-4ab8-9267-2194bece6ba9 · outbound

This paper cites CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.628104Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.628104Z digest=sha256:25644e792a580a94fd07287f778ebf5d2b999430de33451bd31b7c8663dd9210

Observation b966ab95-d45a-4334-a0b9-ba15c86ccff5 · outbound

This paper cites MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:23.566218Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T12:29:17.720704Z digest=sha256:19b3a35c5156dbcffb4e4cf2a076f79f8d238807c4687fadd6809a51139bc19f

Observation 08259e35-cb6d-4722-9b32-b986b9a79b8e · outbound

This paper cites HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.936773Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.936773Z digest=sha256:1e347eb14bc8bdfea01041fc433b9b8a4421ecde987f8dc2a90fb83e23195503

Observation 28ff50ae-dac9-4b29-ad6e-4aa66b623c37 · outbound

This paper cites The RedMonk Programming Language Rankings: June 2024,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation The RedMonk Programming Language Rankings: June 2024,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:23.204754Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T12:29:18.074472Z digest=sha256:040882ae005876c44a200d80abca5ccd37e9a26238996cc3fe72a75ceba295e0

Observation 17e14ba7-40c0-475d-9163-b51da64b5e20 · outbound

This paper cites BLEU: a method for automatic evaluation of machine translation,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation BLEU: a method for automatic evaluation of machine translation,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:22.910899Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T12:29:18.185855Z digest=sha256:2fc7195729ebb3854c916cce9d5cbee8b7711d6fca15adbba5633c986b44ae8f

Observation 889cb942-2ff9-4f1b-844a-d6d684838f2d · outbound

This paper cites CodeBLEU: a Method for Automatic Evaluation of Code Synthesis.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation CodeBLEU: a Method for Automatic Evaluation of Code Synthesis

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:18.364837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:18.364837Z digest=sha256:9ed188f99ecc2bd9dfae6cd8aca7ddf1ec667fca8f323df938b89d998a5ef2a9

Observation fb1ad3e0-5e03-4ab1-aeff-d7c4f5f9f56d · outbound

This paper cites Rethinking Benchmark and Contamination for Language Models with Rephrased Samples.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Rethinking Benchmark and Contamination for Language Models with Rephrased Samples

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:18.525978Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:18.525978Z digest=sha256:0a5f962cd72ce5460d47eb1404151eaaebe7af565e8a8df62f30a43ed9bcd155

Observation e5e5128d-a80f-418b-8437-e1711082ceea · outbound

This paper cites DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:18.701253Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:18.701253Z digest=sha256:25b94f3a49dc45c0e35d845136369f16c859d1a3a4166222060aa7a5402f2045

Observation a067a680-2594-451c-a942-61d846b27d0d · outbound

This paper cites ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:18.835891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:18.835891Z digest=sha256:1fb1ba2177348b45c00412caf252153493a6505ef1a91990cc321fb7b0a8a474

Observation 0ed1519f-bcdd-4d7b-9da1-022f0af9d30a · outbound

This paper cites CrossCodeEval: A Diverse and Multilingual Benchmark for Cross-File Code Completion.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation CrossCodeEval: A Diverse and Multilingual Benchmark for Cross-File Code Completion

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:18.912346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:18.912346Z digest=sha256:b31b0e262bbf014201fe7d41720ec42d32981383a152d80301b8983dcdffdf7b

Observation 3b067938-c473-46de-8d0b-3fae1dd81151 · outbound

This paper cites JavaBench: A Benchmark of Object-Oriented Code Generation for Evaluating Large Language Models.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation JavaBench: A Benchmark of Object-Oriented Code Generation for Evaluating Large Language Models

Reference 24

Resolution
verified exact
local_arxiv, observed 2026-08-07T12:29:19.900313Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T12:29:18.981766Z digest=sha256:90773fa6167f0c250181709ce9cff2143138b59b396c3117f49ab9e0278c2285

Observation 420e91c7-9ceb-44a7-802d-b81cf01f07ec · outbound

This paper cites mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:19.036173Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:19.036173Z digest=sha256:376792b879f25ebf9872fed16c1d112f8e10dbc021905bb9229a32ad22d92ccc

Observation a4d59dc5-d10c-4dec-b44c-3c756e2311f8 · outbound

This paper cites DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:19.084876Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:19.084876Z digest=sha256:ec3d5133244f8b45787c97169fc6b3d8a4ad64e62cee94372ed82606a97f1b6e

Observation 2e236130-4401-4941-b8b7-dd26f15a5daf · outbound

This paper cites Qwen2.5-Coder Technical Report.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Qwen2.5-Coder Technical Report

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:19.117475Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:19.117475Z digest=sha256:6bfba1622818d4de361cae12442f2243a0afcf5cdd66afcfb7bfc99297e5359e

Observation 50e71aca-cd44-43f1-b3e0-ee6ecb237f6e · outbound

This paper cites Codestral: Hello, World!,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Codestral: Hello, World!,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:22.594838Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T12:29:19.175383Z digest=sha256:753764b44716e934e25c28fbb897405742a51b6d7c0d06722dec9ed59cecb6cf

Observation 1cb66ead-1dad-43e4-8f56-ea15961c4df8 · outbound

This paper cites CPP-UT-Bench: Can LLMs Write Complex Unit Tests in C++?.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation CPP-UT-Bench: Can LLMs Write Complex Unit Tests in C++?

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-08-07T12:29:19.561417Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T12:29:19.236375Z digest=sha256:b0d1edb7304e3b801cdd0935d9306e912556fbe3a5d99ff986f60e7ebc398a15

Observation cc0aa898-2ecb-4237-9d8a-c5a1cccae062 · outbound

This paper cites HumanEval.jl,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation HumanEval.jl,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:22.214898Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T12:29:19.286705Z digest=sha256:53377c4cebef4d1191d4e7a5244f0bc210eddb57d0c58f7e6f2eafe00d381b2a

Observation 4fbff495-e80d-48c8-9c27-092512988089 · outbound

This paper cites Rust Compiling Benchmark,.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation Rust Compiling Benchmark,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T12:29:21.924760Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.

source=pdf_text observed=2026-08-07T12:29:19.342174Z digest=sha256:627957bb7e5fad77eadd6558d5fc051e24a5eb96f29148b2995891b4fbb608fc

Observation 87e2efdb-0046-440d-9965-ce658358a6ec · outbound

This paper cites MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation.

SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-07T12:29:17.854881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:29:17.854881Z digest=sha256:fc56677d2ffffd66bd07ffe7b264430cd28978fb7810fc4aa56d151f9a6ac036

Pith citing papers

No inbound Pith citation observations are available.