{"as_of":"2026-08-15T19:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b2214f17d59ec875952ea76ec7350fd8284ba0a7f7e9eaab1b2e3ac355721717","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:15:27.811027Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08266/citation-record","integrity":"/paper/2608.08266/integrity","json":"/paper/2608.08266/citation-record.json","paper":"/paper/2608.08266"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.883955Z","title":"In- tellicode compose: code generation using transformer,","venue":null,"work_id":"2d64685f-8c5c-4be0-91ee-c1c6cf2d4426","year":2020},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.477382Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:668a42c1553e77d20957970524e5da54fba17a916ea5bfa084dcff7aed87d571","observation_id":"6e93653f-e357-4836-9f0d-3e8cb519fa4c","resolution":{"observed_at":"2026-08-12T00:15:29.889232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-12T00:15:27.483965Z","title":"Evaluating large language models trained on code,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.483965Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:367835af860e5b512cab80128fd52ad32ff79109feb61f3eae5b3bb0d42603dd","observation_id":"877a3a7d-f6f4-4373-9075-e6d02936af85","resolution":{"observed_at":"2026-08-12T00:15:27.483965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.867304Z","title":"SWE-bench: Can language models resolve real-world GitHub issues?","venue":null,"work_id":"0eed76b2-70d9-4568-8284-6b57dfde3083","year":2024},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.490111Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:536cbdfc9201383e4ed16eee90f9898f8e8859b9e8af8e47c4dc9d14e985ab69","observation_id":"17d18d29-37c6-4de7-a433-60a30775feb4","resolution":{"observed_at":"2026-08-12T00:15:29.872981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.843299Z","title":"Grounded copi- lot: How programmers interact with code-generating models,","venue":null,"work_id":"3833339e-1b35-4a21-892c-98cc0d033d04","year":2023},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.496038Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:143c364aeb91eb463743788df99fc735806be88ff7e15729f884ed27cb0dd3f6","observation_id":"4a874b0f-f250-4d20-8977-143a61dee2ab","resolution":{"observed_at":"2026-08-12T00:15:29.851862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.824073Z","title":"Security weaknesses of copilot-generated code in GitHub projects: An empirical study,","venue":null,"work_id":"2e694c7f-25a4-4ff3-bcab-e9cd164c38ba","year":2025},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.501758Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:5a3c921a119e0b04ab3238b2abb99c08634ed395d7956840bc469fdfda80a693","observation_id":"06bddc3f-c8b3-4d2f-a2bd-bc7376315fdf","resolution":{"observed_at":"2026-08-12T00:15:29.829988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.805998Z","title":"Towards understanding the characteristics of code generation errors made by large language models,","venue":null,"work_id":"5b03de58-69f0-4685-a8f6-909fd5bb4349","year":2025},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.512294Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:cce675fa376006a40c1e602160107c2d867bd3a8f8c5435e3f51941dcded1020","observation_id":"951b6ab5-a4a3-43f2-aba8-f5472d1c9c20","resolution":{"observed_at":"2026-08-12T00:15:29.812477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.789054Z","title":"The counterfeit conundrum: Can code lan- guage models grasp the nuances of their incorrect generations?","venue":null,"work_id":"78001333-d805-4b52-868e-5acaef13f095","year":2024},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.519104Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:c49d34b69edc28836a3f925fee0de57799b8e680c3eb89da8bd6728acfca0018","observation_id":"3577482a-3108-49f5-9e20-97a6e1c724f1","resolution":{"observed_at":"2026-08-12T00:15:29.794242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.768733Z","title":"Theoracleprobleminsoftwaretesting:Asurvey,","venue":null,"work_id":"08fd52bc-36ef-452b-960e-35f496435fd0","year":2015},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.524564Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:7b8a5b55a081ac547d10936a0e995ea0712e0e72fd5000ba914db4f732048dfa","observation_id":"04ac78fc-cb0a-42f1-bf13-fc8f9ecebb41","resolution":{"observed_at":"2026-08-12T00:15:29.773546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.750893Z","title":"Justaskforcalibration:Strategies for eliciting calibrated confidence scores from language models fine-tuned with human feedback,","venue":null,"work_id":"7df146cb-aa64-49c5-b2a5-759884365391","year":2023},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.533572Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:4ca2b96a4bf1df837b8c45b69818360d61975a4d1b178e654b458e9fbe4e45c6","observation_id":"2e8662ee-86b1-44b1-b7c6-078b1641ed17","resolution":{"observed_at":"2026-08-12T00:15:29.757064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.727713Z","title":"Calibration and correctness of language models for code,","venue":null,"work_id":"ace200b4-b544-4755-9026-a7d645fd36b6","year":2025},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.539073Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:4443f521c0bff5aa932b0f1501ef78abd94d3ebe3aa3f4c38a0b6420e8202c18","observation_id":"ec70991c-df18-41cc-86e9-ae935561f171","resolution":{"observed_at":"2026-08-12T00:15:29.734956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.706809Z","title":"On LLMs’ internal representation of code correctness,","venue":null,"work_id":"67ded7ca-e47d-4300-955a-050b59d65d5b","year":2026},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.544629Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:085ae4de0a9b6a07467f8bc7bd8713b3acd9b8fc9c010c3a028368dbda40aa9a","observation_id":"e2f7a0e6-0154-4df4-bacf-c6fb1540aa19","resolution":{"observed_at":"2026-08-12T00:15:29.714600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.688763Z","title":"The internal state of an LLM knows when it’s lying,","venue":null,"work_id":"1a579c7e-ad0d-48a1-8f70-bb1a617e9c6a","year":2023},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.550016Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:9fba9f0a5e8860d8e6825c4d886b393eafce6fa1e76c6fee49cce214e62e1805","observation_id":"10eeb383-e3d8-46ac-bf3b-12988748ab97","resolution":{"observed_at":"2026-08-12T00:15:29.693672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06824","last_updated":"2024-08-19T01:18:41Z","snapshot_observed_at":"2026-07-06T16:30:37.867641Z","submitted_at":"2023-10-10T17:54:39Z","title":"The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06824","snapshot_observed_at":"2026-08-12T00:15:27.555203Z","title":"The geometry of truth: Emer- gent linear structure in large language model representations of true/false datasets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.555203Z"},"links":{"cited_paper":"/paper/2310.06824","citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:4168076dbb35d89676b91a49eb5ee6f4bfb0415ac32a5eceb93ca474b897fd52","observation_id":"fbbc40d2-f6c0-426e-8212-1fc1624ccc49","resolution":{"observed_at":"2026-08-12T00:15:27.555203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.671332Z","title":"Discovering latent knowledge in language models without supervision,","venue":null,"work_id":"d47908f0-36a9-4481-99eb-5809c9bdef0e","year":2023},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.561731Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:ee5fee7b1481b654d20f03e203d778bcf98fb833dff6c8885992625bb6343a02","observation_id":"6bbba6f8-3c22-4e6c-8a1a-5eef5803e0fb","resolution":{"observed_at":"2026-08-12T00:15:29.677517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-12T00:15:27.567144Z","title":"Representation engineering: A top-down approach to AI transparency,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.567144Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:4780f07b64f20e0fcdcaa363812686461b0bad4f831a3f6c48eaa857e43a796d","observation_id":"cf3d792a-fb7c-4c8a-bd53-e2aae564c61e","resolution":{"observed_at":"2026-08-12T00:15:27.567144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:27.573341Z","title":"A unified understanding and evaluation of steering methods,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.573341Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:50eee3de3f26bb7679fd2f07fd07a2f355b3cd093ce0e05620f031a7a4a35b41","observation_id":"5a80088c-9d98-417a-8a8c-48449a052a0a","resolution":{"observed_at":"2026-08-12T00:15:27.573341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15877","last_updated":"2025-04-01T08:36:44Z","snapshot_observed_at":"2026-08-14T15:45:30.011625Z","submitted_at":"2024-06-22T15:52:04Z","title":"BigCodeBench: Benchmarking Code Generation with Diverse Function Calls and Complex Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15877","snapshot_observed_at":"2026-08-12T00:15:27.578999Z","title":"BigCodeBench: Benchmarking code generation with diverse function calls and complex instructions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.578999Z"},"links":{"cited_paper":"/paper/2406.15877","citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:d03f7c83015c990e8614d9ebad1da2cd747d6df6ac04eae2f0ad4164dcf0b033","observation_id":"105803a4-9f5d-43df-80e7-d6e281737d44","resolution":{"observed_at":"2026-08-12T00:15:27.578999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-12T00:15:27.585505Z","title":"Program synthesis with large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.585505Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:3fcc1e22010c262c5d14878bd5cd2a208af625c758cfb116dfc928591e3c1fcf","observation_id":"9025859a-db23-4db2-b2f3-eafc183a55a7","resolution":{"observed_at":"2026-08-12T00:15:27.585505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.643915Z","title":"Is your code generated by ChatGPT really correct? rigorous evaluation of large language models for code generation,","venue":null,"work_id":"7d2cd32c-b578-4b42-ae94-25c4c1eb2705","year":2023},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.592054Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:6139ff5414784e2b8c69b5c2c844719e13fa6d0b8da3759adbe69db9ad421b92","observation_id":"1e907841-bae2-4bc3-a7e2-4ea34aacff98","resolution":{"observed_at":"2026-08-12T00:15:29.658163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:27.598961Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.598961Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:8d8adbbdb359f09fe1bf7f71dd13f69ba7356cc89313629327c829f99d5d3ee8","observation_id":"233147c0-30ef-416d-a4ed-8c18fcbb2844","resolution":{"observed_at":"2026-08-12T00:15:27.598961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.612399Z","title":"Inference-time intervention: Eliciting truthful answers from a language model,","venue":null,"work_id":"a01eb802-2d05-4e44-a9fa-8dee647e2c37","year":2023},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.603645Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:141d205b4d18e77a1bc27bd438576796373ef949bc61bc5a77dc63f269ff5463","observation_id":"ca461b9f-42b8-47a6-9f2b-f94c33d1eeb1","resolution":{"observed_at":"2026-08-12T00:15:29.619242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.593701Z","title":"Principal component analysis,","venue":null,"work_id":"6b0f7325-5600-4f61-b535-76b72cce2657","year":2010},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.609121Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:a1d78b371254d8865409947cbc45c1226dd86372165c07cf9959595f3dd0ea85","observation_id":"3f69ca45-5c69-40c2-9c7b-aaee36175acc","resolution":{"observed_at":"2026-08-12T00:15:29.599552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-12T00:15:27.613962Z","title":"Language models (mostly) know what they know,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.613962Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:8c99256c5ac428fbf26f4bca8b624539e5782adb9dba61c50d4debeae65ba5ae","observation_id":"43971965-fdbb-4614-9411-a674dbb661da","resolution":{"observed_at":"2026-08-12T00:15:27.613962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.573654Z","title":"Sifting through the chaff: On utilizing execution feed- back for ranking the generated code candidates,","venue":null,"work_id":"9b1011cd-8ab3-49bc-95ca-dde263ee8b08","year":2024},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.619749Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:dffa85438816a7c5add33700aebf967b17eb0e311e2e9310a96ce67c5df4a6e0","observation_id":"55d5e476-13b2-402e-8cf5-c843dae8592e","resolution":{"observed_at":"2026-08-12T00:15:29.580268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.548617Z","title":"astroid: A common base representation of python source code,","venue":null,"work_id":"a0a9c92c-2d62-41a4-add4-b10a83769827","year":2024},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.625004Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:6a62936a7f077e11e71b1b4b38020e65315b5c63b87c81d0a8a9dd4e134dcf0d","observation_id":"20abe70c-221c-4dbd-9983-ea0e058b2921","resolution":{"observed_at":"2026-08-12T00:15:29.556225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.527028Z","title":"Are mutants a valid substitute for real faults in software testing?","venue":null,"work_id":"07cf4952-5075-42ab-85ee-5734da8de87a","year":2014},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.629429Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:7d046fd53c8242deacfc4bd902c7e498d54fea4a0bac5ffa3fff9c8102009231","observation_id":"2f981508-16eb-4fd7-8584-a88651a0981b","resolution":{"observed_at":"2026-08-12T00:15:29.534463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-12T00:15:27.634934Z","title":"Qwen2.5-Codertechnicalreport,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.634934Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:0e6d3a990d7f304509f1d2f4d5779cf2ed446cbb771208edeb7ad77b28257e4f","observation_id":"f528ce79-a430-4fb0-ac23-0ad4d0db8031","resolution":{"observed_at":"2026-08-12T00:15:27.634934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.502639Z","title":"Model-agnostic quality assessment for LLM-generated code via dynamic internal representation selection,","venue":null,"work_id":"a1ebd87f-5cb1-4db2-9bd3-7885cb2682ac","year":2026},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.640409Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:40ab3ceddc047c5f46a578fe2a4ba1b9a5f514e7b70d05e09b4a379894a7c988","observation_id":"984e61b7-771f-46f0-bc32-0b30099aa377","resolution":{"observed_at":"2026-08-12T00:15:29.508624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.476114Z","title":"Probing classifiers: Promises, shortcomings, and advances,","venue":null,"work_id":"56af966b-833f-4295-b601-bf76d743e3af","year":2022},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.646478Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:8b7b319294c00a5f6648e63b735c44138572c17387e8df5677fa58705839eda0","observation_id":"3a0aa7bc-35bf-49a6-9bdc-9a6ab97dd86a","resolution":{"observed_at":"2026-08-12T00:15:29.483479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.450200Z","title":"Designing and interpreting probes with control tasks,","venue":null,"work_id":"422bee9f-b8c2-45d1-82c9-b3d70a2ae4f0","year":2019},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.651644Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:6220f98cd3104d2123d2eb0939e311657f2c8273157298c0e0535f135d107de8","observation_id":"1b5ee281-1079-4a65-9025-3e0d51655520","resolution":{"observed_at":"2026-08-12T00:15:29.457140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.432356Z","title":"Probingtheprobing paradigm: Does probing accuracy entail task relevance?","venue":null,"work_id":"882b4dd4-21bf-4d9d-9b78-ce88e46e11bc","year":2021},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.658166Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:064cc67bbbf2948c87a65b0db1dd8bca4ca8c5572572cea3af6d19e7d05c161c","observation_id":"866dd0fd-62fe-44eb-9d9d-72a05f3bdee6","resolution":{"observed_at":"2026-08-12T00:15:29.437575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.413651Z","title":"Amnesic probing: Behavioral explanation with amnesic counterfactuals,","venue":null,"work_id":"b59f3688-83a1-46ef-bb06-fce54384c670","year":2021},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.663983Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:f554706eb90579eda6b42a70bd4c16308b7b6203743deab695f5efadc84a7827","observation_id":"956918f9-deee-45ce-9b85-6fce21efb410","resolution":{"observed_at":"2026-08-12T00:15:29.420608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.385326Z","title":"Probing classifiers are unreliable for concept removal and detection,","venue":null,"work_id":"55b87dcd-2f64-408e-bab3-8c9e612ee178","year":2022},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.671328Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:f0297ba3cb11d34f0db68ef6836554424971abce13300b2fd251fcae97600ad8","observation_id":"a3fc7e49-cf0b-4259-9e35-fa3a61a3e823","resolution":{"observed_at":"2026-08-12T00:15:29.393262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.359623Z","title":"Semantic bug seeding: A learning- based approach for creating realistic bugs,","venue":null,"work_id":"fcd9c295-2820-458a-8a18-58e91c0b01c1","year":2021},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.677111Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:a6facea23a138e146aaae264da91f55fbf1098aaf4ba50e9a4a23cdddc58211c","observation_id":"49a90a7e-46d7-432e-ae7a-57799b7e2ee0","resolution":{"observed_at":"2026-08-12T00:15:29.368419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.336020Z","title":"Learningrealisticmutations:Bug creation for neural bug detectors,","venue":null,"work_id":"08d90e1e-88f6-46fd-8879-0e391dcd6761","year":2022},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.682540Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:ebe22537a60f06da3b6a871605bf1d68d7dfe1f42d172f82863c49625e4a495c","observation_id":"c2a10e7b-199b-453c-844e-3db071438fb9","resolution":{"observed_at":"2026-08-12T00:15:29.346430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.301349Z","title":"On distribution shift in learning-based bug detectors,","venue":null,"work_id":"4da43b1b-8486-4b9b-a4e6-5c600d0ca963","year":2022},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.688620Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:077bb96cf20587efc7a31aff783ef87e54426ff244f783e602f6cc8bbe1bd515","observation_id":"e1cf6848-5e56-42e2-8d63-b78a11d1df34","resolution":{"observed_at":"2026-08-12T00:15:29.309513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.245112Z","title":"Large language models of code fail at completing code with potential bugs,","venue":null,"work_id":"13d7ae60-bb02-4ebc-8a6b-f2f74a26a075","year":2023},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.694570Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:7dd508f783ad5b944cc5d19a205be4e555eeccb5857f2d5a7c9b07e0eb0afe95","observation_id":"f4d00e17-e670-4c54-b3c7-4069bbd6b41d","resolution":{"observed_at":"2026-08-12T00:15:29.267087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.197468Z","title":"On the universal truthfulness hyperplane inside LLMs,","venue":null,"work_id":"99b1a62b-5218-4662-827b-b5844c35fe62","year":2024},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.700031Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:a3e4c85c75d390f9a8e099e34291f3dd11504e629e85ca929ec5dec554a59f95","observation_id":"c170a50a-94a1-4359-8d7d-2097cd0429b2","resolution":{"observed_at":"2026-08-12T00:15:29.209872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.175359Z","title":"Probing the geometry of truth: Consistency and generalization of truth directions in LLMs across logical transformations and question answering tasks,","venue":null,"work_id":"078c836d-bbc1-4c9d-9dd5-7d181bfa2982","year":2025},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.705099Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:efc145f0eea5f1181484bef1e1a7be967e03ad55f838f153ae0224ec10d16643","observation_id":"27d87201-f698-42ec-b0e1-b566be2bdec8","resolution":{"observed_at":"2026-08-12T00:15:29.181399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:27.710684Z","title":"The truth- fulness spectrum hypothesis,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.710684Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:0e5f3b9c7cb5b7c6c7856312fe1edb3d3d7d91256d05900a8efaf371ce48cbaf","observation_id":"7e286f9b-bd6c-4a1e-b83c-affe119ff2b7","resolution":{"observed_at":"2026-08-12T00:15:27.710684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.147562Z","title":"Correctness assessment of code generated by large language models using internal representations,","venue":null,"work_id":"b3df3ad7-06c9-49fd-a848-4354d1944d4e","year":2025},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.715508Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:4271b80907a3c855617b3821f870e580aa1317c75f7a1434a278e6480966b174","observation_id":"02e1ab20-b429-4726-9e1d-2b8936af9daa","resolution":{"observed_at":"2026-08-12T00:15:29.158848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.09924","last_updated":"2026-08-11T17:36:11Z","snapshot_observed_at":"2026-08-14T23:11:35.688442Z","submitted_at":"2026-02-10T15:57:00Z","title":"LLMs Encode Their Failures: Predicting Success from Pre-Generation Activations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.09924","snapshot_observed_at":"2026-08-12T00:15:27.720442Z","title":"LLMs encode their failures: Predicting success from pre-generation activations,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.720442Z"},"links":{"cited_paper":"/paper/2602.09924","citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:2b2f94a381708c71e544c5fef2910bb05d27dc8e63c8cf45ed0e24b280edf60b","observation_id":"04b114ee-6da1-4788-8b3f-b491e1c509b9","resolution":{"observed_at":"2026-08-12T00:15:27.720442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.125990Z","title":"Risk assess- ment framework for code LLMs via leveraging internal states,","venue":null,"work_id":"95b91db7-1a50-4ced-8633-a45e0fa3adc0","year":2025},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.725558Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:a83a0ca083f0f0755482136ba8f476ba8de5a0711ee926ed902a681397c5ef56","observation_id":"fa053f60-75e7-4c9b-bf44-6b01ead5317f","resolution":{"observed_at":"2026-08-12T00:15:29.134448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:27.731169Z","title":"Localized calibrated uncertainty in code language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.731169Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:9ba0c74788eaf0c268fbfacd2fa2c6186e3260495872f0bf6eb7fd06770c3eb0","observation_id":"e87dedce-ebf2-449e-947e-1bf07837bfb8","resolution":{"observed_at":"2026-08-12T00:15:27.731169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:27.736628Z","title":"Mechanistic interpretability of code correctness in llms via sparse autoencoders,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.736628Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:fe998ba654bf5ff5c601c98666f5f1ed273a5c60ad176f4790baca9adf7eb3df","observation_id":"20a283e3-e804-485b-b22f-0e0d1d3b3185","resolution":{"observed_at":"2026-08-12T00:15:27.736628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:27.741684Z","title":"Code- Circuit: Toward inferring LLM-generated code correctness via attribution graphs,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.741684Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:e53a91278b85c7b119f0c5bf0a5ec0e512f0ce4d073970494f051bcc7b4bbcc0","observation_id":"78d22ae2-ec23-4f3c-b2d8-e9ad0c32b590","resolution":{"observed_at":"2026-08-12T00:15:27.741684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.100913Z","title":"Emergentrepresentationsofprogramse- manticsinlanguagemodelstrainedonprograms,","venue":null,"work_id":"fb808eee-b044-4f11-9e5d-4785c71b266e","year":2024},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.748171Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:8e8c2955241def887e84ba6e66a23bf8c72c0118a34d32eb7a2bb6c138b2d1dc","observation_id":"9ca37055-02f3-42b8-8c18-d758295ca45e","resolution":{"observed_at":"2026-08-12T00:15:29.108509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.075994Z","title":"Large language models for code: Security hardening and adversarial testing,","venue":null,"work_id":"7c66ad27-1a70-40d8-9999-28dfdd759b85","year":2023},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.754549Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:ee2c001dcf79c2bd72d381302ae6712de11055c201553938c91f5eb795a858e7","observation_id":"6595ae70-6712-4d79-9955-54747d398513","resolution":{"observed_at":"2026-08-12T00:15:29.082713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.09508","last_updated":"2025-07-13T06:27:33Z","snapshot_observed_at":"2026-08-15T01:34:42.383009Z","submitted_at":"2025-07-13T06:27:33Z","title":"A Mixture of Linear Corrections Generates Secure Code","version":1},"cited_work":{"arxiv_id":"2507.09508","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.09508","snapshot_observed_at":"2026-08-12T00:15:28.050505Z","title":"A Mixture of Linear Corrections Generates Secure Code","venue":"cs.CR","work_id":"6878a9b2-372c-410e-8f68-705982a304f8","year":2025},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.759902Z"},"links":{"cited_paper":"/paper/2507.09508","citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:df0ee7ea648c4c0c468b16837b77bb969bd38426a3c630fdaa3ca41e38b4fb00","observation_id":"4787b928-da74-40c0-8b65-ba750ea9d413","resolution":{"observed_at":"2026-08-12T00:15:28.059625Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.058118Z","title":"Steering large language models for vulnerability detection,","venue":null,"work_id":"7a5cb351-2c6a-49dc-a5a9-25d8b90c4ee1","year":2025},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.765980Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:0ccc89687af89d9507633773b151da5316f1e0b4ca4c877a53d5f00b7d881008","observation_id":"91bdffa1-6118-4ea0-be7b-7aab2a813383","resolution":{"observed_at":"2026-08-12T00:15:29.063678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.10375","last_updated":"2026-04-08T22:00:24Z","snapshot_observed_at":"2026-07-06T21:24:30.201020Z","submitted_at":"2025-05-15T14:59:17Z","title":"Are Sparse Autoencoders Useful for Java Function Bug Detection?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.10375","snapshot_observed_at":"2026-08-12T00:15:27.770578Z","title":"Are sparse autoencoders useful for java function bug detection?","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.770578Z"},"links":{"cited_paper":"/paper/2505.10375","citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:d49c10be18ac62342a59433d16b6cff4be312c4ae34fc7c02cdb491a5ea52c81","observation_id":"edf809b3-65eb-45f6-8e16-3ebf8a04af48","resolution":{"observed_at":"2026-08-12T00:15:27.770578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05419","last_updated":"2025-04-07T18:42:01Z","snapshot_observed_at":"2026-08-10T14:15:51.214375Z","submitted_at":"2025-04-07T18:42:01Z","title":"Reasoning Models Know When They're Right: Probing Hidden States for Self-Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05419","snapshot_observed_at":"2026-08-12T00:15:27.776270Z","title":"Reasoning models know when they’re right: Probing hidden states for self-verification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.776270Z"},"links":{"cited_paper":"/paper/2504.05419","citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:3370c60cc6dc04dfbe99242c7de7b655f771786498faf6f4b0cdc18862a44f43","observation_id":"344778ce-3ac8-441f-9c03-a599cab63584","resolution":{"observed_at":"2026-08-12T00:15:27.776270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:27.783096Z","title":"No answer needed: Predicting llm answer accuracy from question-only linear probes,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.783096Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:cda8e12a17c580133f98714a5da3b8605dc3340489bb031d70afeddd8357cfaa","observation_id":"313d14a4-4f59-4cc0-ae99-8c5a7c4ceba2","resolution":{"observed_at":"2026-08-12T00:15:27.783096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08159","last_updated":"2026-07-29T23:20:58Z","snapshot_observed_at":"2026-08-06T12:57:47.499722Z","submitted_at":"2026-02-08T23:27:10Z","title":"The Confidence Manifold: Geometric Structure of Correctness Representations in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.08159","snapshot_observed_at":"2026-08-12T00:15:27.787692Z","title":"The confidence manifold: Geometric structure of correctness representations in language models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.787692Z"},"links":{"cited_paper":"/paper/2602.08159","citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:e5811e5db54231b34c8bd6e27d3fa7f9af8b8126d053a9861845c0b387a1b4d1","observation_id":"f40d70a3-dee2-49ce-982f-779c15591e09","resolution":{"observed_at":"2026-08-12T00:15:27.787692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.041259Z","title":"ReCode: Robustness evaluation of code generation models,","venue":null,"work_id":"bce77290-f057-445b-a22b-12d284063bd1","year":2023},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.793486Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:e606e5430fee445369deb7507162dbda1fc12eba8b4ec4741c7f0b8d54a3fad7","observation_id":"e204c350-10ab-4e78-952a-f3bdaafc945f","resolution":{"observed_at":"2026-08-12T00:15:29.046534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:27.798858Z","title":"Semantic robustness of models of source code,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.798858Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:f69953c229f1e0611bedc4052e388789a6d7beb749496164116797b3cacdc47a","observation_id":"4fca3363-7114-4e61-9223-9b1fec745fc3","resolution":{"observed_at":"2026-08-12T00:15:27.798858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:29.012834Z","title":"Contrastive code representation learning,","venue":null,"work_id":"5794beea-c705-49ac-9513-ec99af535f94","year":2021},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.803943Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:fd83e23da5b4a99aed195dc581668ef5e538a6df1b4a0be0cfe12c0e914aa3da","observation_id":"685770ba-b533-4edc-8bc9-14f6fac4d64e","resolution":{"observed_at":"2026-08-12T00:15:29.019004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:15:28.985977Z","title":"An automated methodol- ogy for generating labeled datasets of semantic errors in code,","venue":null,"work_id":"27e0d13a-3b40-4e99-bdbe-83df6daeabe8","year":2026},"citing_paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:27.811027Z"},"links":{"citing_paper":"/paper/2608.08266"},"observation_digest":"sha256:1bc897611407c39aa4579f0cd0acc6bc98c99edb93c543fc91397bdb35e9e57e","observation_id":"3768ae7c-8ebf-4c5a-bc02-f04928fba6f4","resolution":{"observed_at":"2026-08-12T00:15:28.993340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.08266","last_updated":"2026-08-08T17:56:31Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-14T17:49:08.695884Z","submitted_at":"2026-08-08T17:56:31Z","title":"On the Robustness of LLMs' Internal Representation of Code Correctness"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":1,"verified_fuzzy":38},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2608.08266."}