Pith. sign in

Paper Citation Record · LEDGER

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation

As of 9 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2608.03535.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.03535 v1

Coverage vector

measured 24 of 24 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T17:14:07.903751Z

measured 24 of 24 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

24 of 24 outbound references displayed

  • verified exact0
  • verified fuzzy19
  • unresolved5
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation e60e575f-6a50-4e9f-8633-511db4d4739a · outbound

This paper cites an unresolved cited work.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-08-05T17:14:08.524030Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.764068Z digest=sha256:c256fbfa8bff929bf5ef4440b6b1d390e0a3ae8f5e3d0e791c0cdfae3ad45d19

Observation e8d4b94b-8de9-4d36-bd13-6be6ac86377b · outbound

This paper cites Program Synthesis with Large Language Models.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation Program Synthesis with Large Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T17:14:07.770257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T17:14:07.770257Z digest=sha256:17e2c08515436c21bcf983a20948aac20fc47cbd307ea2526834053a401f06a3

Observation bf20932a-f147-4de8-a8d3-df22327356f9 · outbound

This paper cites In: 2025 IEEE/ACM 2nd International Conference on AI Foundation Models and Software Engineering (FORGE).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: 2025 IEEE/ACM 2nd International Conference on AI Foundation Models and Software Engineering (FORGE)

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.503473Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.777616Z digest=sha256:4d571c7e4ed3a14c02112094235050b37cfee3c42183e4b2a815a5bf2f1b5712

Observation bdcdd895-b877-4576-9b94-841e85899d12 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation Evaluating Large Language Models Trained on Code

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T17:14:07.784348Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T17:14:07.784348Z digest=sha256:447b86d87cba42eec0b395330431f9c8d834669961596a378b159e8198e083d2

Observation b59d397d-8b35-4cae-a7f3-24a381b4da9c · outbound

This paper cites Biometrika 37(3–4), 256–266 (1950) 16 S.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation Biometrika 37(3–4), 256–266 (1950) 16 S

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.483421Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.789495Z digest=sha256:a0cad57ab73d96997c2adf886d1db6dfca8bcdb742fddfd55411941a7e04462e

Observation eeeb9676-1bd7-4eb4-83d2-21f2941a02bd · outbound

This paper cites In: Proc.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Proc

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.465692Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.795382Z digest=sha256:2aff188ce91dfad85380a84855d354fb2dbdd9b90d128857ec45fe78f1fc5283

Observation 5580e694-9e1e-4a92-a9db-9194b0dba413 · outbound

This paper cites ACM Transactions on Software Engineering and Methodology33(8), 1–79 (2024).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation ACM Transactions on Software Engineering and Methodology33(8), 1–79 (2024)

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.444260Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.802879Z digest=sha256:71175f08f0969ae28532a18ae57e2fe8e6028927db22a43d2bc4b4e663411f33

Observation 412fb120-6a9e-4fa2-ae8a-096aee8d52d4 · outbound

This paper cites an unresolved cited work.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-05T17:14:08.420614Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.808051Z digest=sha256:55a5290a248202f792dfe5fa4e688abc27d080c9f01c99d0f5b7c7c65b93d236

Observation 92093728-3b9b-4590-b160-603be860f058 · outbound

This paper cites In: Proc.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Proc

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.394550Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.814037Z digest=sha256:f22876825dbf2a7368d27f2182e88b44c7d08ab1ba2b54f8f4ce3b5dbd84aff7

Observation 84fc1ddb-41c5-459c-8a75-f691c86db7ab · outbound

This paper cites In: International Conference on Learning Representations (2025).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: International Conference on Learning Representations (2025)

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.373805Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.818825Z digest=sha256:df41516680fb641ac24cd0497841f4d64af90adf30ae014fa1e7934c88380a58

Observation df03c12b-456f-436c-b5f1-17cd4322e26c · outbound

This paper cites 22nd ACM SIG- SOFT International Symposium on Foundations of Software Engineering (FSE).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation 22nd ACM SIG- SOFT International Symposium on Foundations of Software Engineering (FSE)

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.354892Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.824173Z digest=sha256:f6497d133295953e32faee61931d281db60866ceeefa03345cf3b0df1b5c2f77

Observation 89838c90-80b1-44a6-af73-97c29c575060 · outbound

This paper cites In: Advances in Neural Information Processing Systems (NeurIPS).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Advances in Neural Information Processing Systems (NeurIPS)

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.335032Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.829552Z digest=sha256:a9a029bf9bdf66652bbb9f2dc8a8afc90310654feb993d7e018fde67e2ad965c

Observation eccda045-25e9-4bda-a555-bbfcee294331 · outbound

This paper cites IEEE Transactions on Software Engineering SE-2(4), 308–320 (1976).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation IEEE Transactions on Software Engineering SE-2(4), 308–320 (1976)

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.315390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.836359Z digest=sha256:feaa5cbe2caa92d0c99b8d14e4bc8d027b462efa6277223eb1bb81aa6bfc0451

Observation bf1b5c0f-1889-41da-8eb2-a179aa20fb61 · outbound

This paper cites In: Proc.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Proc

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.295485Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.842126Z digest=sha256:58cb0b8f54819d036b8be7566be4ac20d74beb9ce4907b25e577ff3a85a5de4e

Observation a0f0014f-a1ba-4413-9fe4-d5ca283cde09 · outbound

This paper cites 2023 ACM SIGSAC Conference on Computer and Communications Security (CCS).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation 2023 ACM SIGSAC Conference on Computer and Communications Security (CCS)

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.277024Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.848107Z digest=sha256:77b1c4a4a087b54d63ccd280e8f708dedb47b3805c20d3f33eb090059ccf5559

Observation c0661c0d-2b1d-47a8-a76e-a17b8f4c1a13 · outbound

This paper cites In: Proc.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Proc

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.254740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.853458Z digest=sha256:48ff21e1c241b4aa601d79cf26c51f6a6726d0c89f41a734da0ec8347f14c7b1

Observation c80ca32c-6b47-4134-ba4d-6c8a9fe13f1b · outbound

This paper cites In: Proc.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Proc

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.233705Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.859967Z digest=sha256:20661607af985219c4660656ed171ab7f26c5ad5f8b4ecd2013316be1cc840d6

Observation 3e177fa8-0e34-4a29-8099-2cdcdd0221b4 · outbound

This paper cites Journal of Systems and Software238, 112885 (2026).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation Journal of Systems and Software238, 112885 (2026)

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.200963Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.864842Z digest=sha256:ef6e92e48a81f0c63315bb309b926b41e0fe9ca293b896ab8255b7fd7d69f9f9

Observation f87d8bf3-ab62-4d9c-9c2a-e34075057b11 · outbound

This paper cites 42nd International Conference on Machine Learning (ICML).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation 42nd International Conference on Machine Learning (ICML)

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.173527Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.871665Z digest=sha256:e5f0dd6894cc33676d704c338c6d077053ce7daad4f1d5d3f6b598b8529cad7d

Observation 875e65b5-4d53-40ea-8719-1ede67dc42bc · outbound

This paper cites Biometrics Bulletin 1(6), 80–83 (1945) CodeAssay: A Multi-Metric, Audited Code-Generation Benchmark 17.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation Biometrics Bulletin 1(6), 80–83 (1945) CodeAssay: A Multi-Metric, Audited Code-Generation Benchmark 17

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.147453Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.877864Z digest=sha256:5bb2a8cd9415c26e165408e470e894e7b8cc9ca3360bf24e3b15716881ad4030

Observation 1ed260ee-cfd6-45ff-8950-ddff883836e9 · outbound

This paper cites In: Proc.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Proc

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.120690Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.885821Z digest=sha256:43dd5823f8f65c993d49ba1842646a9273ad567238dfd9c38ee523d534978318

Observation 71167ad2-66e9-4311-b64a-fc622995aa8e · outbound

This paper cites In: Proc.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Proc

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.095562Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.891766Z digest=sha256:949fc73529724a0152b678d1b7f8c3ee26a0b6134d30c5b87b81d7c40ce78c9a

Observation de004fe9-a825-4661-90da-7af60fb827bf · outbound

This paper cites Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T17:14:07.898036Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T17:14:07.898036Z digest=sha256:2652b495dbb9417229377b66272df44aeffefa30e143e3e31497985e054574a2

Observation f622dab2-246a-4223-a682-952f770d8a7e · outbound

This paper cites In: Proc.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Proc

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.060964Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-08-05T17:14:07.903751Z digest=sha256:bedd6378f6a7541bddc94100be9947e9215a395eca6d69a0a969230a252cbb8c

Pith citing papers

No inbound Pith citation observations are available.