{"as_of":"2026-08-23T10:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:936d25efaffd655d3ad38b2c3d4bebd33dad6f34d4a237e8775147260204e640","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:57:53.769079Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19366/citation-record","integrity":"/paper/2607.19366/integrity","json":"/paper/2607.19366/citation-record.json","paper":"/paper/2607.19366"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-02T11:57:51.367172Z","title":"Constitutional AI: Harmlessness from AI feedback.arXiv preprint arXiv:2212.08073, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:51.367172Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:1e7dd4838fab1e5769532f4eb7721dc73f4648ea1ba834b8c58c359b1ece3464","observation_id":"77878a51-adfe-4ce1-a2f4-87cffac742b1","resolution":{"observed_at":"2026-08-02T11:57:51.367172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:57:51.468624Z","title":"Dhillon, Joydeep Ghosh, and Suvrit Sra","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:51.468624Z"},"links":{"citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:badbd2f35934e8c6e9b93ee8e01c865527fad95d01506902972a05806d21eff1","observation_id":"bd93902b-13eb-4f73-9cae-c70ede09db63","resolution":{"observed_at":"2026-08-02T11:57:51.468624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:57:51.610755Z","title":"Towards monosemanticity: Decomposing language models with dictionary learning.Transformer Circuits Thread, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:51.610755Z"},"links":{"citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:d47db72143efe8b3888e268c733a8867d066e95a73b6811822e066690873c293","observation_id":"4f2702e4-26be-4eb3-b53a-28150e736412","resolution":{"observed_at":"2026-08-02T11:57:51.610755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-16T13:08:51.920120Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-02T11:57:51.775694Z","title":"Pappas, and Eric Wong","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:51.775694Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:704110350773b2dac4ef1ecbaca2ef30565d4e81f1bd73d8d9a7902cc193e209","observation_id":"150d54bc-4265-44b9-862e-d8a5575a3f11","resolution":{"observed_at":"2026-08-02T11:57:51.775694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-18T09:57:42.767716Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24445","snapshot_observed_at":"2026-08-02T11:57:51.928730Z","title":"Safety as polytope: Learning polytope constraints for LLM safety","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:51.928730Z"},"links":{"cited_paper":"/paper/2505.24445","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:b202f7f54ee5a5fb71c443b99983e13b3be958b4cbb732919c6e438739d7f785","observation_id":"9d400a3f-0fe4-42db-8206-794618102f72","resolution":{"observed_at":"2026-08-02T11:57:51.928730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-08-21T17:39:12.921162Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08600","snapshot_observed_at":"2026-08-02T11:57:52.065478Z","title":"Sparse autoen- coders find highly interpretable features in language models.arXiv preprint arXiv:2309.08600, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:52.065478Z"},"links":{"cited_paper":"/paper/2309.08600","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:42e5c858d1ab0a82a8cb384d38b879faacc04fd950c58670e66c7932ccfc74ff","observation_id":"6e9adfc7-38c7-407d-ae5b-18d37ae03f35","resolution":{"observed_at":"2026-08-02T11:57:52.065478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:57:52.145415Z","title":"Toy models of superposition.Transformer Circuits Thread, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:52.145415Z"},"links":{"citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:46bd93d4439c2c6cd6cf350e46615e744185e2a1e98951e98b4505c54e94b64a","observation_id":"bb189223-be72-455a-9256-a01c19b0770e","resolution":{"observed_at":"2026-08-02T11:57:52.145415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-08-12T20:12:20.465098Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18495","snapshot_observed_at":"2026-08-02T11:57:52.223916Z","title":"WildGuard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of LLMs.arXiv preprint arXiv:2406.18495, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:52.223916Z"},"links":{"cited_paper":"/paper/2406.18495","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:ec1c148f9ade3e5c4518c246ae67d95e936a9bada1b132cb08b32fb44ca411f0","observation_id":"74081f2b-cef8-45c7-914c-27c9431aae08","resolution":{"observed_at":"2026-08-02T11:57:52.223916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-08-14T15:42:19.849118Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-02T11:57:52.312889Z","title":"LlamaGuard: LLM- based input-output safeguard for human-AI conversations.arXiv preprint arXiv:2312.06674, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:52.312889Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:23c3542dd8d89bd359bc36aa4b0f47ae83e04bd63eb31efec11597fae703f76c","observation_id":"f722afdd-539e-4cdb-8252-557146f93424","resolution":{"observed_at":"2026-08-02T11:57:52.312889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:57:52.439436Z","title":"BeaverTails: Towards improved safety alignment of LLM via a human-preference dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:52.439436Z"},"links":{"citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:c9d628134cfad10a1b795b95cbcf358cd8bf5837db2bc64d06a5d2a24fe9876d","observation_id":"58c61947-c126-4803-a8eb-8ddab689f2e2","resolution":{"observed_at":"2026-08-02T11:57:52.439436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:57:52.559072Z","title":"Inference- time intervention: Eliciting truthful answers from a language model.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:52.559072Z"},"links":{"citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:7321cb6e648aae8cfa7ae4ea8ffa09e845905b2fb75a1010c2e7c5f3fc74fc83","observation_id":"5d0d0f3a-666e-4ce8-be28-424ded230a3f","resolution":{"observed_at":"2026-08-02T11:57:52.559072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:57:52.647395Z","title":"A holistic approach to undesired content detection in the real world.AAAI, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:52.647395Z"},"links":{"citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:77b372ee3d7de176daf2293c8d9f54d552021692719108cae70117796ab49141","observation_id":"0c8e92cc-e22c-4ed0-a184-d58a99a65790","resolution":{"observed_at":"2026-08-02T11:57:52.647395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-08-16T09:07:20.265665Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-02T11:57:52.737493Z","title":"HarmBench: A standardized evaluation framework for automated red teaming and robust refusal.arXiv preprint arXiv:2402.04249, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:52.737493Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:3db86d7751266dedd4a0707e24d91785acc0242271c4b234ef9ced1aed45e1cf","observation_id":"a750113e-2e70-473d-9980-9ea70180cc5f","resolution":{"observed_at":"2026-08-02T11:57:52.737493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00941","last_updated":"2023-09-07T20:36:48Z","snapshot_observed_at":"2026-08-16T15:03:48.794640Z","submitted_at":"2023-09-02T13:37:34Z","title":"Emergent Linear Representations in World Models of Self-Supervised Sequence Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00941","snapshot_observed_at":"2026-08-02T11:57:52.868313Z","title":"Emergent linear representations in world models of self-supervised sequence models.arXiv preprint arXiv:2309.00941, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:52.868313Z"},"links":{"cited_paper":"/paper/2309.00941","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:f29213713e85418eff479f7bf95977bfdc4365e7bd36075ff79ff8892f7e6e4b","observation_id":"f3671bb1-a417-463a-ad44-4b3f8319f5e1","resolution":{"observed_at":"2026-08-02T11:57:52.868313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:57:52.958633Z","title":"Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:52.958633Z"},"links":{"citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:50539fbd8f41732f5799200da25d9734e9a17793d7687b48cedae88975bb5a45","observation_id":"7488ea7b-05ca-4470-9376-817762b3a2ba","resolution":{"observed_at":"2026-08-02T11:57:52.958633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03658","last_updated":"2024-07-17T22:24:27Z","snapshot_observed_at":"2026-08-16T23:25:38.049210Z","submitted_at":"2023-11-07T01:59:11Z","title":"The Linear Representation Hypothesis and the Geometry of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03658","snapshot_observed_at":"2026-08-02T11:57:53.017890Z","title":"The linear representation hypothesis and the geometry of large language models.arXiv preprint arXiv:2311.03658, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:53.017890Z"},"links":{"cited_paper":"/paper/2311.03658","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:4b3ec32007fe1be338618ab5b0a64ddb05a27d961cccb9392f1f2f968cb68b45","observation_id":"1603682f-82ab-4b0a-9273-83061eca3aa8","resolution":{"observed_at":"2026-08-02T11:57:53.017890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T11:57:53.086161Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:53.086161Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:23257933693571e4a7374bf2a12bcad0e0292605341998cbd7f5a0281c47839f","observation_id":"b0d48bd6-e79f-4ea3-93c0-7ebe0c72afd0","resolution":{"observed_at":"2026-08-02T11:57:53.086161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10501","last_updated":"2023-10-16T15:20:30Z","snapshot_observed_at":"2026-08-16T14:51:42.822750Z","submitted_at":"2023-10-16T15:20:30Z","title":"NeMo Guardrails: A Toolkit for Controllable and Safe LLM Applications with Programmable Rails","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10501","snapshot_observed_at":"2026-08-02T11:57:53.165247Z","title":"NeMo Guardrails: A toolkit for controllable and safe LLM applications with pro- grammable rails.arXiv preprint arXiv:2310.10501, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:53.165247Z"},"links":{"cited_paper":"/paper/2310.10501","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:fb0c2e4c20d52cb7eaa026dd51a7cdd9cbdf02405b804525022143446292bf40","observation_id":"ab4c7147-9760-4409-b01c-cb4f85453004","resolution":{"observed_at":"2026-08-02T11:57:53.165247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-02T11:57:53.206211Z","title":"Activation addition: Steering language models without optimization.arXiv preprint arXiv:2308.10248, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:53.206211Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:51e1c97145ecdbdda123ab61deb7489272f594627e4579c710f1ee39d3228db6","observation_id":"95c63058-a6d1-4ec1-88ab-4b7763ef1908","resolution":{"observed_at":"2026-08-02T11:57:53.206211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T11:57:53.340057Z","title":"Jailbroken: How does LLM safety training fail?NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:53.340057Z"},"links":{"citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:d433028cf3d22063af034b7c83cf404cc83085eb013a1ba1b1fa78d17690a4ce","observation_id":"944f9811-02ef-4b9c-bd97-9eaacec4baaa","resolution":{"observed_at":"2026-08-02T11:57:53.340057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-02T11:57:53.490496Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:53.490496Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:1e8917c79a2d0b898813fbe3bcb11e7be909c1d3abfc05eca2c96433f41c092e","observation_id":"c406c5c3-c19a-4e0c-ae8e-5de522131c7a","resolution":{"observed_at":"2026-08-02T11:57:53.490496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-02T11:57:53.641472Z","title":"Byun, Zifan Wang, Alex Mallen, Steven Basart, Sanmi Koyber, Dawn Song, Matt Fredrikson, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:53.641472Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:96cc80c9ac278bf79f440b85195dba0d4841ecfe11282a67adf04e9dcdb4a658","observation_id":"cd89a195-e45f-4813-88c7-9dbb2266b53c","resolution":{"observed_at":"2026-08-02T11:57:53.641472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-02T11:57:53.769079Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T11:57:53.769079Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2607.19366"},"observation_digest":"sha256:d52030af649488732bf9a496b146cdd6f40b0daf292a07580c0ee338e4af4e58","observation_id":"130d19d9-d915-4bd6-83f4-d7f57e8bdee1","resolution":{"observed_at":"2026-08-02T11:57:53.769079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19366","last_updated":"2026-06-09T08:47:00Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T02:55:14.511048Z","submitted_at":"2026-06-09T08:47:00Z","title":"Geometry-Guided Constraint Learning for LLM Safety Classification"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2607.19366."}