{"as_of":"2026-08-08T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:46472e8bcd5a4a3adaf2e8dcb3a022fb08ffbf17e8303a863b00e4545559f3ec","coverage":[{"denominator":10,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:26:58.398605Z","state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T17:43:48.456679Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T17:49:23.561376Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15868","last_updated":"2025-07-15T03:22:07Z","snapshot_observed_at":"2026-08-06T17:18:05.300187Z","submitted_at":"2025-07-15T03:22:07Z","title":"Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models","version":1},"cited_work":{"arxiv_id":"2507.15868","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15868","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2507.15868v1 , year=","venue":null,"work_id":"11674f11-e1f1-4f00-b48e-83ec9dc37ea4","year":null},"citing_paper":{"arxiv_id":"2605.13284","last_updated":"2026-05-13T10:00:58Z","snapshot_observed_at":"2026-08-03T00:43:33.304650Z","submitted_at":"2026-05-13T10:00:58Z","title":"Learning Perturbations to Extrapolate Your LLM","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-14T17:43:48.456679Z"},"links":{"cited_paper":"/paper/2507.15868","citing_paper":"/paper/2605.13284"},"observation_digest":"sha256:44f0398c16a0719e9ce0387b57b5a15e75a4709b259b55fc303b04b0c761d52c","observation_id":"97a4f4e8-8bda-4573-83b9-0eee35b170c4","resolution":{"observed_at":"2026-05-14T17:49:23.563898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15868/citation-record","integrity":"/paper/2507.15868/integrity","json":"/paper/2507.15868/citation-record.json","paper":"/paper/2507.15868"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.14655","last_updated":"2025-04-20T15:28:16Z","snapshot_observed_at":"2026-08-07T16:00:46.114758Z","submitted_at":"2025-04-20T15:28:16Z","title":"LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14655","snapshot_observed_at":"2026-08-06T17:26:57.798530Z","title":"LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15868","last_updated":"2025-07-15T03:22:07Z","snapshot_observed_at":"2026-08-06T17:18:05.300187Z","submitted_at":"2025-07-15T03:22:07Z","title":"Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:57.798530Z"},"links":{"cited_paper":"/paper/2504.14655","citing_paper":"/paper/2507.15868"},"observation_digest":"sha256:8d0ed0a256db112347e546e2415c2071924f7093bf188c8384dd82e9f874a334","observation_id":"1a497670-7b41-4cbb-b7e6-25af520195d5","resolution":{"observed_at":"2026-08-06T17:26:57.798530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:59.052909Z","title":"Halstead","venue":null,"work_id":"3d7978e2-9f83-4ff7-a8e5-03e389acd1b9","year":1977},"citing_paper":{"arxiv_id":"2507.15868","last_updated":"2025-07-15T03:22:07Z","snapshot_observed_at":"2026-08-06T17:18:05.300187Z","submitted_at":"2025-07-15T03:22:07Z","title":"Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:57.884653Z"},"links":{"citing_paper":"/paper/2507.15868"},"observation_digest":"sha256:ff887657fc160cddaffab172eadf491037c2e77a1d2f458d4d4277ebe14266c0","observation_id":"545bc79d-90d7-4a0c-a540-2cf8b4bf5d9d","resolution":{"observed_at":"2026-08-06T17:26:59.132730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:58.955803Z","title":"Adversarial ex- amples for evaluating reading comprehen- sion systems","venue":null,"work_id":"ce040553-dc75-4efc-9cd2-ee84e84fe90b","year":2021},"citing_paper":{"arxiv_id":"2507.15868","last_updated":"2025-07-15T03:22:07Z","snapshot_observed_at":"2026-08-06T17:18:05.300187Z","submitted_at":"2025-07-15T03:22:07Z","title":"Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:57.959899Z"},"links":{"citing_paper":"/paper/2507.15868"},"observation_digest":"sha256:980450882ccc24f29d137ed3e7fe0ce6c96051cc1ec5adf96f1c56f568e49246","observation_id":"99e5430a-a6ad-4153-b26f-3c63df448ba0","resolution":{"observed_at":"2026-08-06T17:26:59.000290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:58.844810Z","title":"On faith- fulness and factuality in abstractive sum- marization","venue":null,"work_id":"b64eec21-6a67-420d-9ebf-cf8a1b072a9a","year":1906},"citing_paper":{"arxiv_id":"2507.15868","last_updated":"2025-07-15T03:22:07Z","snapshot_observed_at":"2026-08-06T17:18:05.300187Z","submitted_at":"2025-07-15T03:22:07Z","title":"Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:58.029361Z"},"links":{"citing_paper":"/paper/2507.15868"},"observation_digest":"sha256:cb279d93e610fc3a1e6f352b0673eecfa2339704e8359fed7f6a2a77b53dd817","observation_id":"e45d585c-6a1d-4fc7-ab1c-e4c385131356","resolution":{"observed_at":"2026-08-06T17:26:58.905222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10235","last_updated":"2023-08-30T04:32:36Z","snapshot_observed_at":"2026-07-06T15:28:40.452146Z","submitted_at":"2023-05-15T15:44:51Z","title":"Assessing Hidden Risks of LLMs: An Empirical Study on Robustness, Consistency, and Credibility","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10235","snapshot_observed_at":"2026-08-06T17:26:58.094112Z","title":"Assessing hidden risks of large language models: An empirical study on robustness, consistency and credi- bility","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15868","last_updated":"2025-07-15T03:22:07Z","snapshot_observed_at":"2026-08-06T17:18:05.300187Z","submitted_at":"2025-07-15T03:22:07Z","title":"Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:58.094112Z"},"links":{"cited_paper":"/paper/2305.10235","citing_paper":"/paper/2507.15868"},"observation_digest":"sha256:3972ad2cfcd9bff6bad8f08ec6d8c2b8c1765fee6ab1398cc70307b5e66bcaf3","observation_id":"6aad6d91-519d-4a76-ad5f-2a5e53c6c458","resolution":{"observed_at":"2026-08-06T17:26:58.094112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-06T17:26:58.175019Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15868","last_updated":"2025-07-15T03:22:07Z","snapshot_observed_at":"2026-08-06T17:18:05.300187Z","submitted_at":"2025-07-15T03:22:07Z","title":"Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:58.175019Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2507.15868"},"observation_digest":"sha256:280dabf0ce2cdae7751f723476506379e016e485f7eb2af825a21c01a1ccdac2","observation_id":"40cacaab-bdfc-4206-80c1-3fe77daf5e67","resolution":{"observed_at":"2026-08-06T17:26:58.175019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:58.673448Z","title":"Univer- sal adversarial triggers for attacking and an- alyzing NLP","venue":null,"work_id":"8b3a6286-54b1-45cc-873d-b83da2a629f4","year":2019},"citing_paper":{"arxiv_id":"2507.15868","last_updated":"2025-07-15T03:22:07Z","snapshot_observed_at":"2026-08-06T17:18:05.300187Z","submitted_at":"2025-07-15T03:22:07Z","title":"Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:58.222319Z"},"links":{"citing_paper":"/paper/2507.15868"},"observation_digest":"sha256:ac3e89b2cdbdc0d6bb8ade328246a39f9dd904a7cec0a57cb6c043157e0040ed","observation_id":"09b41dde-eeb1-464e-b564-beb7cf2a7739","resolution":{"observed_at":"2026-08-06T17:26:58.771370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:26:58.566407Z","title":"Don’t take the easy way out: Ensemble based methods for avoid- ing known dataset biases","venue":null,"work_id":"24058220-783c-4968-a64a-ebb988f4bb9c","year":2019},"citing_paper":{"arxiv_id":"2507.15868","last_updated":"2025-07-15T03:22:07Z","snapshot_observed_at":"2026-08-06T17:18:05.300187Z","submitted_at":"2025-07-15T03:22:07Z","title":"Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:58.300798Z"},"links":{"citing_paper":"/paper/2507.15868"},"observation_digest":"sha256:20bddf17115cd084a3ac09fc08cfaa888e61beba51f4f9e7a720f2dc60b63854","observation_id":"99e8532f-c972-49c5-884b-903363f99cc0","resolution":{"observed_at":"2026-08-06T17:26:58.623531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-06T17:26:58.346488Z","title":"Beyond the imitation game: Quantifying and examining the ca- pabilities of language models (BIG-Bench)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15868","last_updated":"2025-07-15T03:22:07Z","snapshot_observed_at":"2026-08-06T17:18:05.300187Z","submitted_at":"2025-07-15T03:22:07Z","title":"Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:58.346488Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2507.15868"},"observation_digest":"sha256:e69252437d44cfa24e7c70a140675b2698ec8b594712c7b2e4f7f701fd79349b","observation_id":"3c6a8bfe-7fae-4a1d-9d39-17efd68b6a66","resolution":{"observed_at":"2026-08-06T17:26:58.346488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-06T17:26:58.398605Z","title":"Jargon Inflation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15868","last_updated":"2025-07-15T03:22:07Z","snapshot_observed_at":"2026-08-06T17:18:05.300187Z","submitted_at":"2025-07-15T03:22:07Z","title":"Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:26:58.398605Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2507.15868"},"observation_digest":"sha256:3e021ba528279f7b2c44066a0d4e9f4dafe4bd83f01245ed93121b6259bc28c4","observation_id":"db0697e7-fef1-419d-8dab-d1b460a130e7","resolution":{"observed_at":"2026-08-06T17:26:58.398605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15868","last_updated":"2025-07-15T03:22:07Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T17:18:05.300187Z","submitted_at":"2025-07-15T03:22:07Z","title":"Small Edits, Big Consequences: Telling Good from Bad Robustness in Large Language Models"},"reference_resolution":{"displayed":10,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":10},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 10 of 10 outbound references and 1 inbound Pith citation observation for arXiv:2507.15868."}