{"as_of":"2026-08-08T21:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:901558f8fb961fe205033de716c09da4e20e4c7253ab0ec4cf13bfb662b18163","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:29:19.342174Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24324/citation-record","integrity":"/paper/2505.24324/integrity","json":"/paper/2505.24324/citation-record.json","paper":"/paper/2505.24324"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T12:29:16.723342Z","title":"Evaluating Large Language Models Trained on Code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:16.723342Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:227393467e03a70ac77b55a9a1e719e27cb0a14a6134755d1bb46cb3e651920f","observation_id":"beea5b85-87fa-4e8f-af78-6c00c5c3b812","resolution":{"observed_at":"2026-08-07T12:29:16.723342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:24.635583Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis,","venue":null,"work_id":"db7d52f1-4db2-4686-9e0b-0ac19722a5ec","year":2022},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:16.771938Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:d9b8555dc6070738a63691ef2ddb18d3ec94aaa750d1776590f9b178358b34dd","observation_id":"fdfd9c76-f6c0-43a0-b88d-7513e345f0ed","resolution":{"observed_at":"2026-08-07T12:29:24.765437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.13169","last_updated":"2022-05-04T16:08:31Z","snapshot_observed_at":"2026-08-06T20:27:50.671898Z","submitted_at":"2022-02-26T15:53:55Z","title":"A Systematic Evaluation of Large Language Models of Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.13169","snapshot_observed_at":"2026-08-07T12:29:16.864754Z","title":"A System- atic Evaluation of Large Language Models of Code,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:16.864754Z"},"links":{"cited_paper":"/paper/2202.13169","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:e5cfd84d84afd78b16ae765e0e07ea6be12550dcccc7d05cced83072801a1803","observation_id":"a7abdd35-4b4e-412e-b899-3b8573467071","resolution":{"observed_at":"2026-08-07T12:29:16.864754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-07T12:29:17.012603Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming – The Rise of Code Intelligence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.012603Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:c9764a64d586d2bc33b8d8f2e7c5db73dc01c6e28d8426a079e376444dc0c3ea","observation_id":"c225c370-6ffa-4b0f-ac48-1692011462c6","resolution":{"observed_at":"2026-08-07T12:29:17.012603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:24.404748Z","title":"Code Llama: Open Foundation Models for Code,","venue":null,"work_id":"b5c66e54-36ec-45eb-9767-7e6e78b3b853","year":null},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.072363Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:48c9f456904c07707fbc3071eb83338e843a30c3297e48735fd123e5a0025625","observation_id":"179b10cf-8abc-4b9c-b004-bbf94ff66f0c","resolution":{"observed_at":"2026-08-07T12:29:24.516278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:24.143513Z","title":"Code Completion by Modeling Flattened Abstract Syntax Trees as Graphs,","venue":null,"work_id":"473ca4bb-7e27-4631-82c7-31d93ffeb961","year":2021},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.100223Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:e40e4b35cbf88f97804636a618e4a7c6ec4a4005622dd2b1e1b68d9769f0d1db","observation_id":"e80f189a-dbe1-49ed-aeab-78742db7615c","resolution":{"observed_at":"2026-08-07T12:29:24.238411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:23.885084Z","title":"Lost in Translation: A Study of Bugs Introduced by Large Language Models while Translating Code,","venue":null,"work_id":"16be09c3-84be-4e4b-9b33-6e00eddf8594","year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.154474Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:ece386306ed94a8480fad19fb56c679926f2fe2028a51cb3a020350ded28648f","observation_id":"993299aa-b9fc-4646-bcbb-4c01309223e5","resolution":{"observed_at":"2026-08-07T12:29:24.005177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04237","last_updated":"2022-09-08T06:50:16Z","snapshot_observed_at":"2026-08-04T15:15:03.597741Z","submitted_at":"2022-07-09T09:57:11Z","title":"Few-shot training LLMs for project-specific code-summarization","version":2},"cited_work":{"arxiv_id":"2207.04237","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.04237","snapshot_observed_at":"2026-08-07T12:29:21.103852Z","title":"Few-shot training LLMs for project-specific code-summarization","venue":"cs.SE","work_id":"d8b6c46c-d4b5-434e-91e8-7026c8b19737","year":2022},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.205650Z"},"links":{"cited_paper":"/paper/2207.04237","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:48add14dfa1cd44b4b753c0665f3e488e36c2fe47c6fc4e36b17e59415cda1c3","observation_id":"f2b866d3-1975-437f-bd25-af74eacae51b","resolution":{"observed_at":"2026-08-07T12:29:21.221743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T12:29:17.258721Z","title":"Program Synthesis with Large Language Models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.258721Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:ae0312ea3bfe53d62f6ff0e466365ea609f02c29d7837c6605f87da6cd6b8688","observation_id":"187c8295-2312-4503-9d86-e9a619655250","resolution":{"observed_at":"2026-08-07T12:29:17.258721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:23.681671Z","title":"Multi-lingual Evaluation of Code Generation Models,","venue":null,"work_id":"16544719-3fde-418a-aff7-49e9cf5a52f1","year":null},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.357832Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:7ad4b6753519326988bf3c72dc163578f0287141523976905249f8fe3418f6bd","observation_id":"1ee8ea2e-ba01-48dd-b29d-1ce5a23110e6","resolution":{"observed_at":"2026-08-07T12:29:23.771090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09420","last_updated":"2023-05-08T10:25:41Z","snapshot_observed_at":"2026-08-03T21:06:36.379863Z","submitted_at":"2022-12-19T12:55:32Z","title":"Large Language Models Meet NL2Code: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09420","snapshot_observed_at":"2026-08-07T12:29:17.440179Z","title":"Large Language Models Meet NL2Code: A Survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.440179Z"},"links":{"cited_paper":"/paper/2212.09420","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:4661146b6453dc51846c7bf5b1a7804f8fb5a6ee463fa73925505298e0124f11","observation_id":"4e8e84b3-d10f-49f2-b574-4d8f8eaf4e04","resolution":{"observed_at":"2026-08-07T12:29:17.440179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.09938","last_updated":"2021-11-08T21:16:44Z","snapshot_observed_at":"2026-08-04T23:13:25.514661Z","submitted_at":"2021-05-20T17:58:42Z","title":"Measuring Coding Challenge Competence With APPS","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.09938","snapshot_observed_at":"2026-08-07T12:29:17.540016Z","title":"Measuring Coding Challenge Competence With APPS,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.540016Z"},"links":{"cited_paper":"/paper/2105.09938","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:031c96aee08024c06b86623737c621fc413c181a760e4c7a789037301098943c","observation_id":"ba0c226f-54b7-4ea7-9d9a-fd90facb5e6b","resolution":{"observed_at":"2026-08-07T12:29:17.540016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13474","last_updated":"2023-02-27T21:26:48Z","snapshot_observed_at":"2026-07-06T12:52:16.992962Z","submitted_at":"2022-03-25T06:55:15Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13474","snapshot_observed_at":"2026-08-07T12:29:17.628104Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.628104Z"},"links":{"cited_paper":"/paper/2203.13474","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:e4eadf8f9f9b3c31a8c90520c66792afb91c4a21dd282996aa23fa23f5206f3c","observation_id":"fcc5be15-61c6-4ab8-9267-2194bece6ba9","resolution":{"observed_at":"2026-08-07T12:29:17.628104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:23.445307Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation,","venue":null,"work_id":"36cadb6e-8a7e-47ac-bed9-b66a51e5e42e","year":null},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.720704Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:0ba88c819c627d53d82ff73ee191058be9d6e925dac940e4bcebba24b336d8ff","observation_id":"b966ab95-d45a-4334-a0b9-ba15c86ccff5","resolution":{"observed_at":"2026-08-07T12:29:23.566218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16694","last_updated":"2024-03-24T15:41:21Z","snapshot_observed_at":"2026-08-03T09:29:36.187988Z","submitted_at":"2024-02-26T16:09:00Z","title":"HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16694","snapshot_observed_at":"2026-08-07T12:29:17.936773Z","title":"HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generaliza- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.936773Z"},"links":{"cited_paper":"/paper/2402.16694","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:c77cbbbb425ba178c0feac358a710b21d521715e3e1d7830aed9c9c86df6228e","observation_id":"08259e35-cb6d-4722-9b32-b986b9a79b8e","resolution":{"observed_at":"2026-08-07T12:29:17.936773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:23.073714Z","title":"The RedMonk Programming Language Rankings: June 2024,","venue":null,"work_id":"a1338a7a-d3e4-4d7f-906a-f03e45c38bf7","year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:18.074472Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:b50c2ec4bb2d5caf98177b55eac67be49bf8ff2bbb9f371d9b10e2695b7f51ce","observation_id":"28ff50ae-dac9-4b29-ad6e-4aa66b623c37","resolution":{"observed_at":"2026-08-07T12:29:23.204754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:22.814772Z","title":"BLEU: a method for automatic evaluation of machine translation,","venue":null,"work_id":"0aa239ea-77f4-404e-adf0-480753e6c863","year":2001},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:18.185855Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:0f53d0494c370b1c0edd93b60074ed1a7f9bc53301ffca9ac362d7525befd848","observation_id":"17e14ba7-40c0-475d-9163-b51da64b5e20","resolution":{"observed_at":"2026-08-07T12:29:22.910899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.10297","last_updated":"2020-09-27T04:07:11Z","snapshot_observed_at":"2026-08-01T07:33:26.380394Z","submitted_at":"2020-09-22T03:10:49Z","title":"CodeBLEU: a Method for Automatic Evaluation of Code Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.10297","snapshot_observed_at":"2026-08-07T12:29:18.364837Z","title":"CodeBLEU: a Method for Automatic Evaluation of Code Synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:18.364837Z"},"links":{"cited_paper":"/paper/2009.10297","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:e44edec16b8012a270b952f92b49183655e0f44fabd1cc944b6e761f1b3a54db","observation_id":"889cb942-2ff9-4f1b-844a-d6d684838f2d","resolution":{"observed_at":"2026-08-07T12:29:18.364837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04850","last_updated":"2023-11-11T05:11:18Z","snapshot_observed_at":"2026-08-07T11:21:12.881808Z","submitted_at":"2023-11-08T17:35:20Z","title":"Rethinking Benchmark and Contamination for Language Models with Rephrased Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04850","snapshot_observed_at":"2026-08-07T12:29:18.525978Z","title":"Rethinking Benchmark and Contamination for Language Models with Rephrased Samples,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:18.525978Z"},"links":{"cited_paper":"/paper/2311.04850","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:db657f9b4aa08e7e0cec99a9854332dab146b11a1bc975ec6f9e12db939524a7","observation_id":"fb1ad3e0-5e03-4ab1-aeff-d7c4f5f9f56d","resolution":{"observed_at":"2026-08-07T12:29:18.525978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11501","last_updated":"2022-11-18T17:20:27Z","snapshot_observed_at":"2026-08-07T20:24:53.074277Z","submitted_at":"2022-11-18T17:20:27Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11501","snapshot_observed_at":"2026-08-07T12:29:18.701253Z","title":"DS-1000: A Natural and Reliable Benchmark for Data Science Code Generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:18.701253Z"},"links":{"cited_paper":"/paper/2211.11501","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:16f885681d5bf6b051874cc9bbc2b310a1969796346fd121f60be334764d563f","observation_id":"e5e5128d-a80f-418b-8437-e1711082ceea","resolution":{"observed_at":"2026-08-07T12:29:18.701253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01861","last_updated":"2023-08-14T09:07:00Z","snapshot_observed_at":"2026-08-03T22:16:12.497107Z","submitted_at":"2023-08-03T16:31:02Z","title":"ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01861","snapshot_observed_at":"2026-08-07T12:29:18.835891Z","title":"ClassEval: A Manually-Crafted Benchmark for Evaluating LLMs on Class-level Code Generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:18.835891Z"},"links":{"cited_paper":"/paper/2308.01861","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:f973ea1ea94a2cb3d5e331f4ec4523fae39d075eaf91ca5f6f14911eced63f2e","observation_id":"a067a680-2594-451c-a942-61d846b27d0d","resolution":{"observed_at":"2026-08-07T12:29:18.835891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11248","last_updated":"2023-11-17T02:51:39Z","snapshot_observed_at":"2026-07-06T16:34:31.299748Z","submitted_at":"2023-10-17T13:18:01Z","title":"CrossCodeEval: A Diverse and Multilingual Benchmark for Cross-File Code Completion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11248","snapshot_observed_at":"2026-08-07T12:29:18.912346Z","title":"Cross- CodeEval: A Diverse and Multilingual Benchmark for Cross-File Code Completion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:18.912346Z"},"links":{"cited_paper":"/paper/2310.11248","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:44126330e3f762df0c6fa6817e15551d9a21bef6915663dae590a085b5cd99aa","observation_id":"0ed1519f-bcdd-4d7b-9da1-022f0af9d30a","resolution":{"observed_at":"2026-08-07T12:29:18.912346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12902","last_updated":"2024-10-11T10:27:16Z","snapshot_observed_at":"2026-07-06T18:33:11.370375Z","submitted_at":"2024-06-10T06:43:25Z","title":"JavaBench: A Benchmark of Object-Oriented Code Generation for Evaluating Large Language Models","version":2},"cited_work":{"arxiv_id":"2406.12902","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.12902","snapshot_observed_at":"2026-08-07T12:29:19.838865Z","title":"JavaBench: A Benchmark of Object-Oriented Code Generation for Evaluating Large Language Models","venue":"cs.LG","work_id":"11b0e4c5-3f10-439c-bf2a-594a5331604c","year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:18.981766Z"},"links":{"cited_paper":"/paper/2406.12902","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:c3d56ec5a17ff8cb86aec78dd04cfde4031ff77fb9cb88017d1ab117578adbd1","observation_id":"3b067938-c473-46de-8d0b-3fae1dd81151","resolution":{"observed_at":"2026-08-07T12:29:19.900313Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15037","last_updated":"2025-01-26T00:56:43Z","snapshot_observed_at":"2026-08-05T15:39:57.235988Z","submitted_at":"2024-10-19T08:44:26Z","title":"mHumanEval -- A Multilingual Benchmark to Evaluate Large Language Models for Code Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15037","snapshot_observed_at":"2026-08-07T12:29:19.036173Z","title":"mHumanEval – A Multilingual Benchmark to Evaluate Large Language Models for Code Generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:19.036173Z"},"links":{"cited_paper":"/paper/2410.15037","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:fa81f9c5360d4c8aba258b8b0dc267eab6983bb2edf31897d7702038bbb67bd5","observation_id":"420e91c7-9ceb-44a7-802d-b81cf01f07ec","resolution":{"observed_at":"2026-08-07T12:29:19.036173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-07T06:30:25.302107Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-07T12:29:19.084876Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:19.084876Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:29063ade1383e324f8b2c4109aeef71c6e240d1a4d15f5522918aa68d0ee816f","observation_id":"a4d59dc5-d10c-4dec-b44c-3c756e2311f8","resolution":{"observed_at":"2026-08-07T12:29:19.084876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T12:29:19.117475Z","title":"Qwen2.5-Coder Technical Report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:19.117475Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:4ff525d05a4d987fb097398429f88fe61613fccaaa0abdba74d0303d21331882","observation_id":"2e236130-4401-4941-b8b7-dd26f15a5daf","resolution":{"observed_at":"2026-08-07T12:29:19.117475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:22.404815Z","title":"Codestral: Hello, World!,","venue":null,"work_id":"1753495e-e34a-40dd-9ca8-3ba823237181","year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:19.175383Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:a22ea13f0a6cb16b54c5d0505bb1e9b8c139101df3d173899c2f9be70b858236","observation_id":"50e71aca-cd44-43f1-b3e0-ee6ecb237f6e","resolution":{"observed_at":"2026-08-07T12:29:22.594838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02735","last_updated":"2024-12-03T18:35:24Z","snapshot_observed_at":"2026-07-06T20:01:10.271420Z","submitted_at":"2024-12-03T18:35:24Z","title":"CPP-UT-Bench: Can LLMs Write Complex Unit Tests in C++?","version":1},"cited_work":{"arxiv_id":"2412.02735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.02735","snapshot_observed_at":"2026-08-07T12:29:19.468767Z","title":"CPP-UT-Bench: Can LLMs Write Complex Unit Tests in C++?","venue":"cs.SE","work_id":"c9e863e4-4493-4c2e-b75b-b6efa96f091b","year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:19.236375Z"},"links":{"cited_paper":"/paper/2412.02735","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:58a239edc58f4a0227994f09b6860cda09f9cbd085a7cd080094116b0abdc6d5","observation_id":"1cb66ead-1dad-43e4-8f56-ea15961c4df8","resolution":{"observed_at":"2026-08-07T12:29:19.561417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:22.084313Z","title":"HumanEval.jl,","venue":null,"work_id":"111ad8af-8e33-4ec0-a5fa-d4c6dc638668","year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:19.286705Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:038a114d98e0ed35e398178a969846cabd169aa479542a1136fb2602cf8f35d6","observation_id":"cc0aa898-2ecb-4237-9d8a-c5a1cccae062","resolution":{"observed_at":"2026-08-07T12:29:22.214898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:29:21.764536Z","title":"Rust Compiling Benchmark,","venue":null,"work_id":"67ecfe1d-87c3-4158-84f0-eea27874073e","year":2024},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:19.342174Z"},"links":{"citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:3d1e9659cc209c1a2646610046ea5b5ef22b2740dc0425fc70783f939f8dc37f","observation_id":"4fbff495-e80d-48c8-9c27-092512988089","resolution":{"observed_at":"2026-08-07T12:29:21.924760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-07-06T13:42:40.131502Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-08-07T12:29:17.854881Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:29:17.854881Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2505.24324"},"observation_digest":"sha256:1ec32da550278487f695047827da49d6e59581db74837d29200f15c556517fd7","observation_id":"87e2efdb-0046-440d-9965-ce658358a6ec","resolution":{"observed_at":"2026-08-07T12:29:17.854881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.24324","last_updated":"2025-05-30T08:06:30Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:22:58.147433Z","submitted_at":"2025-05-30T08:06:30Z","title":"SwiftEval: Developing a Language-Specific Benchmark for LLM-generated Code Evaluation"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":3,"verified_fuzzy":11},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2505.24324."}