Pith. sign in

Paper Citation Record · LEDGER

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation

As of 8 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2608.03535.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.03535 v1

Coverage vector

measured 24 of 24 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T17:14:07.903751Z

measured 24 of 24 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

24 of 24 outbound references displayed

  • verified exact0
  • verified fuzzy19
  • unresolved5
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation e60e575f-6a50-4e9f-8633-511db4d4739a · outbound

This paper cites an unresolved cited work.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-08-05T17:14:08.524030Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.764068Z digest=sha256:81077e088b985061375609b7c34c21c6aa43630efecb7d7797830b7a652f5f3d

Observation e8d4b94b-8de9-4d36-bd13-6be6ac86377b · outbound

This paper cites Program Synthesis with Large Language Models.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation Program Synthesis with Large Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T17:14:07.770257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T17:14:07.770257Z digest=sha256:17e2c08515436c21bcf983a20948aac20fc47cbd307ea2526834053a401f06a3

Observation bf20932a-f147-4de8-a8d3-df22327356f9 · outbound

This paper cites In: 2025 IEEE/ACM 2nd International Conference on AI Foundation Models and Software Engineering (FORGE).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: 2025 IEEE/ACM 2nd International Conference on AI Foundation Models and Software Engineering (FORGE)

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.503473Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.777616Z digest=sha256:42174cf8906520fa418a45914a40d7db348ddc3c8a62eed04a2459ffa8d404be

Observation bdcdd895-b877-4576-9b94-841e85899d12 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation Evaluating Large Language Models Trained on Code

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T17:14:07.784348Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T17:14:07.784348Z digest=sha256:447b86d87cba42eec0b395330431f9c8d834669961596a378b159e8198e083d2

Observation b59d397d-8b35-4cae-a7f3-24a381b4da9c · outbound

This paper cites Biometrika 37(3–4), 256–266 (1950) 16 S.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation Biometrika 37(3–4), 256–266 (1950) 16 S

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.483421Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.789495Z digest=sha256:8203454d5708cd2104d4d44515a7b61cd06a186ef0f88355936eba3d38aa8630

Observation eeeb9676-1bd7-4eb4-83d2-21f2941a02bd · outbound

This paper cites In: Proc.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Proc

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.465692Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.795382Z digest=sha256:f269898eb6e546502e19de114de8847cd5ae05efd1120688b31461339bda4fc2

Observation 5580e694-9e1e-4a92-a9db-9194b0dba413 · outbound

This paper cites ACM Transactions on Software Engineering and Methodology33(8), 1–79 (2024).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation ACM Transactions on Software Engineering and Methodology33(8), 1–79 (2024)

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.444260Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.802879Z digest=sha256:795ef14436f5e635ec1af858bf38ae1f3abcd83f64251dc53ac2f44a9a9f495a

Observation 412fb120-6a9e-4fa2-ae8a-096aee8d52d4 · outbound

This paper cites an unresolved cited work.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-05T17:14:08.420614Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.808051Z digest=sha256:25c3ee913c26a9d2dec5f22c07fc0c89d949e5626b0ba5bc5626879a81c52fde

Observation 92093728-3b9b-4590-b160-603be860f058 · outbound

This paper cites In: Proc.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Proc

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.394550Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.814037Z digest=sha256:176c38cbdd23a10af47bd86acd372b70bcc197dfbcf4c3adf79050a741a1056e

Observation 84fc1ddb-41c5-459c-8a75-f691c86db7ab · outbound

This paper cites In: International Conference on Learning Representations (2025).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: International Conference on Learning Representations (2025)

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.373805Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.818825Z digest=sha256:c436d0672eaf8e44b7d34007a77fe7dd22dfef6222378c493a189b8b58f919c9

Observation df03c12b-456f-436c-b5f1-17cd4322e26c · outbound

This paper cites 22nd ACM SIG- SOFT International Symposium on Foundations of Software Engineering (FSE).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation 22nd ACM SIG- SOFT International Symposium on Foundations of Software Engineering (FSE)

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.354892Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.824173Z digest=sha256:f7940d02fe8dbefa859c6f2af87f20b4a7a0ea0e69719163d7a6eaeb98e49866

Observation 89838c90-80b1-44a6-af73-97c29c575060 · outbound

This paper cites In: Advances in Neural Information Processing Systems (NeurIPS).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Advances in Neural Information Processing Systems (NeurIPS)

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.335032Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.829552Z digest=sha256:cab8e192b01cb7a3d0d62ac801dd26963439f8ba0a2d1fee0bd631f9e2cc48ee

Observation eccda045-25e9-4bda-a555-bbfcee294331 · outbound

This paper cites IEEE Transactions on Software Engineering SE-2(4), 308–320 (1976).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation IEEE Transactions on Software Engineering SE-2(4), 308–320 (1976)

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.315390Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.836359Z digest=sha256:5457365cd023303c01c5c0090535512d3b9b7d85fcc3c73cb9510ff780fea23e

Observation bf1b5c0f-1889-41da-8eb2-a179aa20fb61 · outbound

This paper cites In: Proc.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Proc

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.295485Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.842126Z digest=sha256:6a4e33c4c8fa56b6d564ef5d967faf338dc6aa1ecb7e8e2d171033aa822a69ac

Observation a0f0014f-a1ba-4413-9fe4-d5ca283cde09 · outbound

This paper cites 2023 ACM SIGSAC Conference on Computer and Communications Security (CCS).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation 2023 ACM SIGSAC Conference on Computer and Communications Security (CCS)

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.277024Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.848107Z digest=sha256:898337df2b39231c8b9f73e1b2c403e7d4d1828396ccf4cd5a5c5dea4283f18a

Observation c0661c0d-2b1d-47a8-a76e-a17b8f4c1a13 · outbound

This paper cites In: Proc.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Proc

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.254740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.853458Z digest=sha256:5d69eba092f77cb53934d7d60f5359d2c6b16261515851b450429e8ddbce5d98

Observation c80ca32c-6b47-4134-ba4d-6c8a9fe13f1b · outbound

This paper cites In: Proc.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Proc

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.233705Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.859967Z digest=sha256:d10a33ef2b6b4851d086552af8c0306fc47d87f1d675c25e3538460a25c94c1a

Observation 3e177fa8-0e34-4a29-8099-2cdcdd0221b4 · outbound

This paper cites Journal of Systems and Software238, 112885 (2026).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation Journal of Systems and Software238, 112885 (2026)

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.200963Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.864842Z digest=sha256:e9ff7d77ccf062381ee9048fc3b677941b13dbb0b3a584012e33294100c35989

Observation f87d8bf3-ab62-4d9c-9c2a-e34075057b11 · outbound

This paper cites 42nd International Conference on Machine Learning (ICML).

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation 42nd International Conference on Machine Learning (ICML)

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.173527Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.871665Z digest=sha256:a6874f36599a38990e994ad72a555f97aa494d1c9cded6150f9a3208f88fa43d

Observation 875e65b5-4d53-40ea-8719-1ede67dc42bc · outbound

This paper cites Biometrics Bulletin 1(6), 80–83 (1945) CodeAssay: A Multi-Metric, Audited Code-Generation Benchmark 17.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation Biometrics Bulletin 1(6), 80–83 (1945) CodeAssay: A Multi-Metric, Audited Code-Generation Benchmark 17

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.147453Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.877864Z digest=sha256:ae8fc46649c1a31175e44ee2efbf363a97080d1d6473b5b9654c539d028aa0d2

Observation 1ed260ee-cfd6-45ff-8950-ddff883836e9 · outbound

This paper cites In: Proc.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Proc

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.120690Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.885821Z digest=sha256:2bd6cb284482e138e251545f9c10f31185506790206d60cbc1059c891193cc82

Observation 71167ad2-66e9-4311-b64a-fc622995aa8e · outbound

This paper cites In: Proc.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Proc

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.095562Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.891766Z digest=sha256:ad49381f1a4cc6809b2aed57d42da0a5a4ed67e000874c4e94ac756fd9c6e7d0

Observation de004fe9-a825-4661-90da-7af60fb827bf · outbound

This paper cites Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation Beyond Correctness: Benchmarking Multi-dimensional Code Generation for Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T17:14:07.898036Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T17:14:07.898036Z digest=sha256:2652b495dbb9417229377b66272df44aeffefa30e143e3e31497985e054574a2

Observation f622dab2-246a-4223-a682-952f770d8a7e · outbound

This paper cites In: Proc.

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation In: Proc

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T17:14:08.060964Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-05T17:14:07.903751Z digest=sha256:cec611761fd36a32f6aa96f57dcb4f4567f28a953312f5503a84cb3444eda160

Pith citing papers

No inbound Pith citation observations are available.