{"as_of":"2026-08-07T22:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a36040144df5acf7742e6493cfbdf34f9163bfe48a9ba47f2eb75e9d392289a5","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:51:53.845119Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T02:11:19.672753Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T13:11:21.271928Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"cited_work":{"arxiv_id":"2507.17389","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17389","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Investigating training data detection in ai coders","venue":null,"work_id":"ff50a55b-8125-4c86-bef5-08dc65c14278","year":2025},"citing_paper":{"arxiv_id":"2604.19488","last_updated":"2026-04-21T14:10:37Z","snapshot_observed_at":"2026-07-06T23:06:07.161558Z","submitted_at":"2026-04-21T14:10:37Z","title":"CoDA: Towards Effective Cross-domain Knowledge Transfer via CoT-guided Domain Adaptation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T02:11:19.672753Z"},"links":{"cited_paper":"/paper/2507.17389","citing_paper":"/paper/2604.19488"},"observation_digest":"sha256:3288bbeec59b2228a1343cb398658adcf1de44f8c44fb184971b7a1554579181","observation_id":"48071e04-609d-4a73-a225-e755b3a4520a","resolution":{"observed_at":"2026-05-11T13:11:21.336531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.17389/citation-record","integrity":"/paper/2507.17389/integrity","json":"/paper/2507.17389/citation-record.json","paper":"/paper/2507.17389"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.476932Z","title":"Our Website","venue":null,"work_id":"e1181ddc-0660-4bc6-8ec7-3ede0a5a679b","year":2025},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.741925Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:1de15290fbde9c38463217ecadb848e420900ce33d386662e0cc3483836adb8d","observation_id":"f6a24efa-1ea7-43df-a269-441e5ebc5dd1","resolution":{"observed_at":"2026-08-06T14:51:54.479939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.467693Z","title":null,"venue":null,"work_id":"0fe9cdc6-4942-421e-8ee2-c40432effedb","year":null},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.745825Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:7d1ce05465474e4fccc7bcc4411c3af5960ad6bb2fa6858eaa410a0538958732","observation_id":"c73661f8-9c62-4e94-bcc6-3b6976bca2fa","resolution":{"observed_at":"2026-08-06T14:51:54.470730Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.458211Z","title":null,"venue":null,"work_id":"7347d677-f1c6-4e89-ba92-a3cb34b54d13","year":2025},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.752764Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:d7d623783fdd33c05b1711640594ea7daf4589717ef63cda8408f20c42146576","observation_id":"4d9c0795-f1f6-4e8c-9f5c-a5f5e66d4e26","resolution":{"observed_at":"2026-08-06T14:51:54.461178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:53.755745Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.755745Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:76e8d5b15594f3b6bf8b4605f20b47049a555ccf53986e3d7e495110295538f2","observation_id":"c448c9b9-b6db-42c5-87c6-17eefbc5d2f0","resolution":{"observed_at":"2026-08-06T14:51:53.755745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08155","last_updated":"2020-09-18T15:38:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-19T13:09:07Z","title":"CodeBERT: A Pre-Trained Model for Programming and Natural Languages","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08155","snapshot_observed_at":"2026-08-06T14:51:53.759459Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.759459Z"},"links":{"cited_paper":"/paper/2002.08155","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:f026859344e0f0b5be8188a1311afc7eb30bf49f420230db1b283fbc5b51e543","observation_id":"37aaf90c-8c02-410e-b8ce-61c6287843ef","resolution":{"observed_at":"2026-08-06T14:51:53.759459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-06T14:51:53.762906Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.762906Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:ec271d9cf011d5a7549a9932c768e25e475bba757d8aa967a97e3fcc4f455708","observation_id":"0f4fe14c-8d93-4ace-b3db-11a2961bd6cd","resolution":{"observed_at":"2026-08-06T14:51:53.762906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.444150Z","title":null,"venue":null,"work_id":"a547ebab-0d5c-485e-adc4-6224fb600b45","year":2022},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.766324Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:82379db1587a083e31b0c8ad9bc5836fa3ef055c7cee0857e617df69a5840190","observation_id":"810c921e-efe7-4853-9a5f-191cf81cafd4","resolution":{"observed_at":"2026-08-06T14:51:54.447111Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06059","last_updated":"2024-01-11T17:24:49Z","snapshot_observed_at":"2026-07-06T17:14:24.413664Z","submitted_at":"2024-01-11T17:24:49Z","title":"Investigating Data Contamination for Pre-training Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06059","snapshot_observed_at":"2026-08-06T14:51:53.769972Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.769972Z"},"links":{"cited_paper":"/paper/2401.06059","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:ae87d914d1b96793996bcb3f8c65d789f48326b1d13b4868b983821f81334bcc","observation_id":"ede787cc-e818-4db0-be20-9d383381e5f6","resolution":{"observed_at":"2026-08-06T14:51:53.769972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15533","last_updated":"2022-11-20T18:15:30Z","snapshot_observed_at":"2026-07-06T14:24:01.962012Z","submitted_at":"2022-11-20T18:15:30Z","title":"The Stack: 3 TB of permissively licensed source code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15533","snapshot_observed_at":"2026-08-06T14:51:53.773724Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.773724Z"},"links":{"cited_paper":"/paper/2211.15533","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:82e1b75bae506ef3c4e98b35c97a24a7454dcd10c116b5d6f12466bf7739354e","observation_id":"fccd12f1-fb4d-47ae-87c2-54e179faec2c","resolution":{"observed_at":"2026-08-06T14:51:53.773724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06161","snapshot_observed_at":"2026-08-06T14:51:53.777247Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.777247Z"},"links":{"cited_paper":"/paper/2305.06161","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:57addca44da74e595c1983e0b06a2df03dc7b85bb2f98b54a706dc62dd922c4d","observation_id":"a0e8f2d8-3747-44e8-9cc9-cb061543db1d","resolution":{"observed_at":"2026-08-06T14:51:53.777247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.435035Z","title":null,"venue":null,"work_id":"7b82ab8a-3192-425b-ad69-9bf3192e640d","year":null},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.780878Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:272342e9d000d88b0a78a69799501e0d126af947566a08945bd13f965e6e3f47","observation_id":"b6645eef-b547-47c8-b7ee-2e9e6f2315b6","resolution":{"observed_at":"2026-08-06T14:51:54.438021Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-05T17:57:59.654845Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-06T14:51:53.788650Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.788650Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:4e3238dd7f923731daefea2b5a9ec1e29392a61215435bc54bb8d8339fc6ebc3","observation_id":"5033f586-a176-4f67-ab6b-e7c12760a395","resolution":{"observed_at":"2026-08-06T14:51:53.788650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01333","last_updated":"2024-06-03T13:58:04Z","snapshot_observed_at":"2026-07-06T18:24:26.225262Z","submitted_at":"2024-06-03T13:58:04Z","title":"Probing Language Models for Pre-training Data Detection","version":1},"cited_work":{"arxiv_id":"2406.01333","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.01333","snapshot_observed_at":"2026-08-06T14:51:54.327926Z","title":"Probing Language Models for Pre-training Data Detection","venue":"cs.CL","work_id":"5ae899a0-cb03-4f03-b752-9a0e8856ab64","year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.791821Z"},"links":{"cited_paper":"/paper/2406.01333","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:8e4ee065d2f85945c5bfb7499938a91d8fadde4a3a66d68b437192f311e69694","observation_id":"95147091-839a-4949-8508-5ce9011bf053","resolution":{"observed_at":"2026-08-06T14:51:54.331327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.426490Z","title":null,"venue":null,"work_id":"709376d1-8864-4b95-8ab4-a31b765eb7b4","year":2025},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.795171Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:a5ea96bd784231a94c4c16bee08c45ce6ef3dda137b3c1b3fe2ab3183ffc8b6b","observation_id":"8a96d7ea-d638-423b-8293-1801ee533ca7","resolution":{"observed_at":"2026-08-06T14:51:54.429453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18462","last_updated":"2023-08-07T06:32:56Z","snapshot_observed_at":"2026-07-06T15:34:59.457879Z","submitted_at":"2023-05-29T07:06:03Z","title":"Membership Inference Attacks against Language Models via Neighbourhood Comparison","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18462","snapshot_observed_at":"2026-08-06T14:51:53.798105Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.798105Z"},"links":{"cited_paper":"/paper/2305.18462","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:64b0b860a435f0bfb747f26324e87c64bb993bf703d8540e854a8a3079ee469a","observation_id":"59fa5440-5692-430b-8751-e1166635ebbd","resolution":{"observed_at":"2026-08-06T14:51:53.798105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-06T14:51:53.801198Z","title":"Li et al","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.801198Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:7a6091a1b0b32cd904299076755d2b3250ca31bba99fcef3ae6e80a250fa817c","observation_id":"2c80d530-4f68-4340-b50a-80800b5b721a","resolution":{"observed_at":"2026-08-06T14:51:53.801198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16789","last_updated":"2024-03-09T22:26:06Z","snapshot_observed_at":"2026-07-06T16:38:29.188225Z","submitted_at":"2023-10-25T17:21:23Z","title":"Detecting Pretraining Data from Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16789","snapshot_observed_at":"2026-08-06T14:51:53.804502Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.804502Z"},"links":{"cited_paper":"/paper/2310.16789","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:b94b2e3c39c554b8638feab25e4053db2ce83987f7a9132afad9cd8e1f4916ac","observation_id":"04eebe5c-2eec-4006-8416-3f67ee1de8c4","resolution":{"observed_at":"2026-08-06T14:51:53.804502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.417856Z","title":null,"venue":null,"work_id":"cd017f0a-e171-4aa0-9bca-cb10d9c7391f","year":null},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.807721Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:f9f8710542503502b067f25fd006019a278382eea527f65625fe5fed1f19ec80","observation_id":"ae33e463-189b-4021-b2b5-d7cc6d610b5f","resolution":{"observed_at":"2026-08-06T14:51:54.420931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09048","last_updated":"2024-12-15T14:37:29Z","snapshot_observed_at":"2026-07-06T19:31:57.906994Z","submitted_at":"2024-10-11T17:59:58Z","title":"Towards Trustworthy LLMs for Code: A Data-Centric Synergistic Auditing Framework","version":2},"cited_work":{"arxiv_id":"2410.09048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.09048","snapshot_observed_at":"2026-08-06T14:51:54.276763Z","title":"Towards Trustworthy LLMs for Code: A Data-Centric Synergistic Auditing Framework","venue":"cs.SE","work_id":"57d340c4-c2e0-4a1a-93b3-4668e9425763","year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.813785Z"},"links":{"cited_paper":"/paper/2410.09048","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:9fd858879adaeb03b13128be68576001f7f16e236817091dd029148921ef57dc","observation_id":"c6b115c7-78a4-43a9-8ecc-0b6df4fcc44c","resolution":{"observed_at":"2026-08-06T14:51:54.281288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:53.816548Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.816548Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:3a256218ef6c2a6243abd26fb2cca8c548cf4782dc508f1cef6b15e75a982156","observation_id":"837f54cd-59ec-404c-b565-70e5a1390271","resolution":{"observed_at":"2026-08-06T14:51:53.816548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.35507","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.170929Z","title":null,"venue":null,"work_id":"b6852f36-42f9-4178-a27c-b69ad99c5bb3","year":2025},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.819039Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:f67c414c9fb44069f98edfd88d8cba6490e6da23d11f6fc1d9047cb7d4dd6fc5","observation_id":"24eaa48e-dd42-48b2-933e-91cf64caf487","resolution":{"observed_at":"2026-08-06T14:51:54.176637Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:53.821665Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.821665Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:4cf2dcae950ea81c22f43d0e4a78efc0d438fca685bc3eaa50539f7d7a050265","observation_id":"008b70ac-fbdb-4243-988d-720a4f2dd332","resolution":{"observed_at":"2026-08-06T14:51:53.821665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15968","last_updated":"2025-05-23T08:57:14Z","snapshot_observed_at":"2026-08-04T08:38:17.194488Z","submitted_at":"2024-06-23T00:23:13Z","title":"ReCaLL: Membership Inference via Relative Conditional Log-Likelihoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15968","snapshot_observed_at":"2026-08-06T14:51:53.824160Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.824160Z"},"links":{"cited_paper":"/paper/2406.15968","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:17289d2e7d6fe86c5c1017ac7d4bce5e07a0c3feb20b4ace48e81eb72a62b5ff","observation_id":"873b7cc3-6e85-486b-92bc-27ca22915f8c","resolution":{"observed_at":"2026-08-06T14:51:53.824160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17264","last_updated":"2024-12-23T04:19:45Z","snapshot_observed_at":"2026-08-04T00:23:37.378388Z","submitted_at":"2024-12-23T04:19:45Z","title":"ACECode: A Reinforcement Learning Framework for Aligning Code Efficiency and Correctness in Code Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17264","snapshot_observed_at":"2026-08-06T14:51:53.826996Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.826996Z"},"links":{"cited_paper":"/paper/2412.17264","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:c6412adfa0c4dbcd2e2bf2afda383368eb5210ce188e79ac5163f7f920483ef9","observation_id":"a356e882-72bc-4a2a-82e4-b9caedb35f36","resolution":{"observed_at":"2026-08-06T14:51:53.826996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01166","last_updated":"2024-10-15T12:58:00Z","snapshot_observed_at":"2026-07-06T16:26:30.291083Z","submitted_at":"2023-10-02T12:50:43Z","title":"Gotcha! This Model Uses My Code! Evaluating Membership Leakage Risks in Code Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01166","snapshot_observed_at":"2026-08-06T14:51:53.830175Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.830175Z"},"links":{"cited_paper":"/paper/2310.01166","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:38e025d6cbfe7d8f5a0eb8a797b32d5398ffbc811b5f783e76a6591d8e58bc56","observation_id":"63bfba6d-9f5b-4859-9376-67809182c415","resolution":{"observed_at":"2026-08-06T14:51:53.830175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.01604","last_updated":"2018-05-04T22:43:43Z","snapshot_observed_at":"2026-08-02T04:15:45.339659Z","submitted_at":"2017-09-05T21:56:24Z","title":"Privacy Risk in Machine Learning: Analyzing the Connection to Overfitting","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.01604","snapshot_observed_at":"2026-08-06T14:51:53.833356Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.833356Z"},"links":{"cited_paper":"/paper/1709.01604","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:fac7366d86f028c1bf5170c7785ada16b2c4c746ef016ff79b5d87d3c3613df0","observation_id":"b64fef41-badf-4003-9549-7af22b4c00eb","resolution":{"observed_at":"2026-08-06T14:51:53.833356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.409378Z","title":null,"venue":null,"work_id":"0efffd37-25ce-47fb-9378-59fb33eb3624","year":2023},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.836317Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:3f9d613df16ec65b25d943cba96ee999c86f8aa4e5997150a2d6bec308e02835","observation_id":"93196f24-36f7-4bf2-956d-6d78bc7cbead","resolution":{"observed_at":"2026-08-06T14:51:54.412195Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02936","last_updated":"2025-02-12T04:41:34Z","snapshot_observed_at":"2026-08-06T22:02:50.460833Z","submitted_at":"2024-04-03T04:25:01Z","title":"Min-K%++: Improved Baseline for Detecting Pre-Training Data from Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02936","snapshot_observed_at":"2026-08-06T14:51:53.839169Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.839169Z"},"links":{"cited_paper":"/paper/2404.02936","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:ea102409f6b50aa446b379b73fc17177109511c687f38680f230d8ef2a5cce5a","observation_id":"34c00687-a372-46be-8ae7-bcb5347cb0e3","resolution":{"observed_at":"2026-08-06T14:51:53.839169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:54.400756Z","title":null,"venue":null,"work_id":"18b400ed-fe5a-439d-b171-a6e2be743aaf","year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.842231Z"},"links":{"citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:15595e0f6fe55e048e945095ae45eb6d6d622a68202b4dbb73282e48dc9ae0de","observation_id":"0c9fe411-2662-481b-93c3-b9dc6923b109","resolution":{"observed_at":"2026-08-06T14:51:54.403659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14781","last_updated":"2025-05-21T03:41:29Z","snapshot_observed_at":"2026-08-04T05:37:22.827625Z","submitted_at":"2024-09-23T07:55:35Z","title":"Pretraining Data Detection for Large Language Models: A Divergence-based Calibration Method","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14781","snapshot_observed_at":"2026-08-06T14:51:53.845119Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.845119Z"},"links":{"cited_paper":"/paper/2409.14781","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:00a36e969c76beec37f0f911783c70bf1ae21034dfa92aab05615a590a6eab50","observation_id":"7fc4b8d2-cf88-4f0a-b520-a16a19c6c187","resolution":{"observed_at":"2026-08-06T14:51:53.845119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.05820","last_updated":"2017-03-31T22:17:07Z","snapshot_observed_at":"2026-07-06T05:15:08.120372Z","submitted_at":"2016-10-18T22:38:33Z","title":"Membership Inference Attacks against Machine Learning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.05820","snapshot_observed_at":"2026-08-06T14:51:53.810911Z","title":"arXiv:1610.05820 [cs.CR] https://arxiv.org/abs/1610.05820","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.810911Z"},"links":{"cited_paper":"/paper/1610.05820","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:b2f90c39e08386d4d7b46e68d00b0e5ad7cf77e7d1b435d6ffc002322a123619","observation_id":"99d9071b-1bed-4162-bcb0-e6a9c06314c5","resolution":{"observed_at":"2026-08-06T14:51:53.810911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.03988","last_updated":"2023-02-24T09:53:40Z","snapshot_observed_at":"2026-08-06T09:28:54.008213Z","submitted_at":"2023-01-09T10:52:35Z","title":"SantaCoder: don't reach for the stars!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.03988","snapshot_observed_at":"2026-08-06T14:51:53.749336Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.749336Z"},"links":{"cited_paper":"/paper/2301.03988","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:14351908b82b1135c0c7cefce180c4f3cbfa0da4e51ec3c84b17df332d1496d1","observation_id":"46061606-9455-48cf-a707-f6350f14070f","resolution":{"observed_at":"2026-08-06T14:51:53.749336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14845","last_updated":"2024-02-19T14:00:39Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-19T14:00:39Z","title":"Purifying Large Language Models by Ensembling a Small Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14845","snapshot_observed_at":"2026-08-06T14:51:53.784719Z","title":"arXiv preprint arXiv:2402.14845 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:53.784719Z"},"links":{"cited_paper":"/paper/2402.14845","citing_paper":"/paper/2507.17389"},"observation_digest":"sha256:112fbdba88488061d253cf959df86dfcffab46a0c744eee2aac664068579cf23","observation_id":"71476e70-499a-4fa5-87a2-841cdf8965a7","resolution":{"observed_at":"2026-08-06T14:51:53.784719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.17389","last_updated":"2025-07-23T10:34:22Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-07T11:21:36.520513Z","submitted_at":"2025-07-23T10:34:22Z","title":"Investigating Training Data Detection in AI Coders"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":1},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 1 inbound Pith citation observation for arXiv:2507.17389."}