{"as_of":"2026-08-17T20:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a70f96e2d2b9c23134f76007b3f6eb5eb84fae4c73b22c3f1dd70c384786dae","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:05:04.820314Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:25:43.377432Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T00:25:43.489612Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"cited_work":{"arxiv_id":"2507.11771","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.11771","snapshot_observed_at":"2026-08-12T00:25:43.489612Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","venue":"cs.LG","work_id":"df04d290-b5a3-4f84-94d0-728c25156645","year":2025},"citing_paper":{"arxiv_id":"2608.08159","last_updated":"2026-08-08T14:37:53Z","snapshot_observed_at":"2026-08-17T11:18:50.407608Z","submitted_at":"2026-08-08T14:37:53Z","title":"When Is a Steerable Concept Representation Real? Measurement Confounds in a Cross-Family Audit of Neuroscience Parallels in LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T00:25:43.377432Z"},"links":{"cited_paper":"/paper/2507.11771","citing_paper":"/paper/2608.08159"},"observation_digest":"sha256:7b0cfd8b7c6caf3803f46c0f23275b5d8b1d2ee011da71c6468d8ab93ab0b11a","observation_id":"472cee5e-8c34-4763-958d-f25e41e2c27e","resolution":{"observed_at":"2026-08-12T00:25:43.493544Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.11771/citation-record","integrity":"/paper/2507.11771/integrity","json":"/paper/2507.11771/citation-record.json","paper":"/paper/2507.11771"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14082","last_updated":"2024-08-23T23:02:28Z","snapshot_observed_at":"2026-07-06T18:03:38.397804Z","submitted_at":"2024-04-22T11:01:51Z","title":"Mechanistic Interpretability for AI Safety -- A Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14082","snapshot_observed_at":"2026-08-06T17:05:03.622889Z","title":"and Gavves, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:03.622889Z"},"links":{"cited_paper":"/paper/2404.14082","citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:25fff2bcff6c14c9d9528aedc81195f3cb0ce78ae7f453c03a45e102d631990e","observation_id":"4047946d-31b8-4f67-8717-90c8410077c6","resolution":{"observed_at":"2026-08-06T17:05:03.622889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:05:05.383021Z","title":"A toy model of universality: Reverse engineering how networks learn group operations","venue":null,"work_id":"28efa2d8-315d-4650-9636-c4f28d5282a9","year":2023},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:03.666165Z"},"links":{"citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:8a87bc5cdb34cf808daf55bb0a8445940e8c19eb5199eb0d4ce9aaaf9da98578","observation_id":"62cb6a61-d972-474a-b3f4-cee12f636adc","resolution":{"observed_at":"2026-08-06T17:05:05.434920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:05:03.761144Z","title":"Towards automated circuit discovery for mechanistic interpretability","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:03.761144Z"},"links":{"citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:0ecd14e8c6e492b90eff6b0b49a4acd39b009c43730ba8fe60dfc1c4e4250a2e","observation_id":"601b57e4-96ce-48b6-a9da-67fd7168c73d","resolution":{"observed_at":"2026-08-06T17:05:03.761144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-08-16T21:36:28.067615Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-08-06T17:05:03.845054Z","title":"Toy models of superposition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:03.845054Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:589d1e841be08714837141631c8d9097b0b3114d6679411854cf07c25a76aa74","observation_id":"90722fc7-0fda-4edf-a2bb-16fcfada84b8","resolution":{"observed_at":"2026-08-06T17:05:03.845054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01610","last_updated":"2023-06-02T21:52:17Z","snapshot_observed_at":"2026-08-17T05:06:29.353999Z","submitted_at":"2023-05-02T17:13:55Z","title":"Finding Neurons in a Haystack: Case Studies with Sparse Probing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01610","snapshot_observed_at":"2026-08-06T17:05:03.916915Z","title":"Finding neurons in a haystack: Case studies with sparse probing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:03.916915Z"},"links":{"cited_paper":"/paper/2305.01610","citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:70762caa8eea2b2ea06c77029398d75128ec5dbf9987e67a9d691d4d3d95853d","observation_id":"f7a901bc-7b60-4059-94c4-2b8109e29806","resolution":{"observed_at":"2026-08-06T17:05:03.916915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00622","last_updated":"2022-02-01T18:15:24Z","snapshot_observed_at":"2026-08-16T17:24:19.582880Z","submitted_at":"2022-02-01T18:15:24Z","title":"Datamodels: Predicting Predictions from Training Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00622","snapshot_observed_at":"2026-08-06T17:05:03.982552Z","title":"M., Engstrom, L., Leclerc, G., and Madry, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:03.982552Z"},"links":{"cited_paper":"/paper/2202.00622","citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:f59e3e5c1d084dfa87ff7f1fbaa1d496e981873380e54e6f330955effe0521d1","observation_id":"14e88341-cb6e-43bd-92b4-c920351d5f2d","resolution":{"observed_at":"2026-08-06T17:05:03.982552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14186","last_updated":"2023-04-03T17:37:50Z","snapshot_observed_at":"2026-08-16T15:45:33.214205Z","submitted_at":"2023-03-24T17:56:22Z","title":"TRAK: Attributing Model Behavior at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14186","snapshot_observed_at":"2026-08-06T17:05:04.041203Z","title":"M., Georgiev, K., Ilyas, A., Leclerc, G., and Madry, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:04.041203Z"},"links":{"cited_paper":"/paper/2303.14186","citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:f2cec7b42fce1b6b89fea333ced3b82e4afb804a2cdf587a979cbd75267679a2","observation_id":"df3b9283-6c2b-4e5d-8145-24e472089997","resolution":{"observed_at":"2026-08-06T17:05:04.041203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-15T08:04:06.283165Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-06T17:05:04.150422Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:04.150422Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:a02f7dc7bb13a1bbb6befd5b5b7207e9aec2fac7ede69c6f71d11f6055db5e3b","observation_id":"5f63daaa-e723-46f2-9e5f-6a78cfe93ced","resolution":{"observed_at":"2026-08-06T17:05:04.150422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:05:05.240705Z","title":"M., Ilyas, A., and Madry, A","venue":null,"work_id":"f40f5959-69b8-4328-b92d-ba0dd630f741","year":2023},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:04.258595Z"},"links":{"citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:6b85a5b6941fc0f9f48b3a13eee9667649cac91a845ebaf03f47cb5376501e4b","observation_id":"253994b4-5436-405c-87b1-8615443815ef","resolution":{"observed_at":"2026-08-06T17:05:05.297143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:05:05.096433Z","title":"Scaling monosemanticity: Extracting interpretable features from claude 3 sonnet","venue":null,"work_id":"2a62ce18-f4d2-47cf-a0ea-282da06e9d6d","year":2024},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:04.338235Z"},"links":{"citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:82cac0f7b081c29e63d6146ef1ffdd2ecee5fe3f4f0197e74a94611b1dd05324","observation_id":"7b4fcd37-a3f9-40dd-880e-4f48ea5a59ac","resolution":{"observed_at":"2026-08-06T17:05:05.162627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-06T17:05:04.423071Z","title":"Activation addition: Steering language models without optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:04.423071Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:7f4b6ad1d521e17ea9a5f3ca039e55a440852b5e079680ea89b8c728700de04f","observation_id":"d045c2ef-959a-4761-9493-bba4b61e0933","resolution":{"observed_at":"2026-08-06T17:05:04.423071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-06T17:05:04.509549Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:04.509549Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:44c3a9ce5a2e22d57fbaffb65a604a971b5de1e231a4af9296bc65f075f4cf31","observation_id":"2201a38b-4fcd-4c41-8296-90544649bed1","resolution":{"observed_at":"2026-08-06T17:05:04.509549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:05:04.599235Z","title":"Jailbroken: How does llm safety training fail? Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:04.599235Z"},"links":{"citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:7d387483a073653dbf8a0fbe6a004e0ebf4dd3fcd7d954f039e9e9876e09a44e","observation_id":"acd26905-b1d2-4e65-a081-912f6b562194","resolution":{"observed_at":"2026-08-06T17:05:04.599235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08319","last_updated":"2024-06-22T08:31:40Z","snapshot_observed_at":"2026-08-16T14:10:17.796124Z","submitted_at":"2024-03-13T08:02:23Z","title":"Knowledge Conflicts for LLMs: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08319","snapshot_observed_at":"2026-08-06T17:05:04.694957Z","title":"Knowledge conflicts for llms: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:04.694957Z"},"links":{"cited_paper":"/paper/2403.08319","citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:931928717a31f83ae5a91b7e340a9275cdf9e9d60d3c804f2b63eccacc175305","observation_id":"b9d183bf-d72a-4cdf-9fbd-c045b2f050d9","resolution":{"observed_at":"2026-08-06T17:05:04.694957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T17:05:04.749036Z","title":"Z., and Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:04.749036Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:2e4af2f06f0fd199f41115a07051cc7bb00991abc38aee273adb0a421b64780d","observation_id":"182fc9f9-0577-4c67-9158-41413fef0fbf","resolution":{"observed_at":"2026-08-06T17:05:04.749036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:05:04.820314Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T17:05:04.820314Z"},"links":{"citing_paper":"/paper/2507.11771"},"observation_digest":"sha256:77362ff98f6badbad040ab6f05de11ae1f5515e408bcd2c7865b0832caf14b1c","observation_id":"2462df79-733e-4f0a-8d58-4bd941ba5c39","resolution":{"observed_at":"2026-08-06T17:05:04.820314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.11771","last_updated":"2025-07-15T22:21:18Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T22:51:15.770136Z","submitted_at":"2025-07-15T22:21:18Z","title":"Scaling laws for activation steering with Llama 2 models and refusal mechanisms"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 1 inbound Pith citation observation for arXiv:2507.11771."}