{"as_of":"2026-08-19T01:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:32c449fb76058edabb9d2ac10266b94f04e12a852560d0a42f3c0c22fb088d2d","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:40:27.706679Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19386/citation-record","integrity":"/paper/2607.19386/integrity","json":"/paper/2607.19386/citation-record.json","paper":"/paper/2607.19386"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:27.562353Z","title":"Pythia: a suite for analyzing large language models across training and scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.562353Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:0c822929879208e98a740ca738b1dad961e961f9f90ab0e3535f38c9ac40f769","observation_id":"fc2acce6-e64e-404b-b50b-54bfd4ce18ca","resolution":{"observed_at":"2026-08-15T15:40:27.562353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:27.567155Z","title":"Language models can explain neurons in language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.567155Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:4a0d2a13bfb9e8d84b774e61a1be403275aaaec6413fb557e60f9ad1aba5864f","observation_id":"d5ac0dbc-c8ba-446f-85e1-6a4309621833","resolution":{"observed_at":"2026-08-15T15:40:27.567155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:27.571356Z","title":"Towards monosemanticity: Decomposing language models with dictionary learning.Transformer Circuits Thread, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.571356Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:0790f79a6a000c05666e399bb497920b78a18dfd764a12738bff0259eac68d8d","observation_id":"62ebb96b-dd1c-4fb2-a426-ecc75b34dbb3","resolution":{"observed_at":"2026-08-15T15:40:27.571356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.339219Z","title":"Learning multi-level features with matryoshka sparse autoencoders","venue":null,"work_id":"8688948f-bdff-405a-89ed-24bcdae96ab0","year":2025},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.575804Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:0a02d1304252d6f1c0d28cd8b1b0fc91a61ec5579bc1872add9c083e63cfce98","observation_id":"5d797047-80a2-4976-806a-58daa5f791d8","resolution":{"observed_at":"2026-08-15T15:40:28.343227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02193","last_updated":"2024-11-21T12:10:54Z","snapshot_observed_at":"2026-08-18T08:38:36.939977Z","submitted_at":"2024-11-04T15:46:20Z","title":"Improving Steering Vectors by Targeting Sparse Autoencoder Features","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02193","snapshot_observed_at":"2026-08-15T15:40:27.580176Z","title":"Improving steering vectors by targeting sparse autoencoder features.arXiv preprint arXiv:2411.02193, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.580176Z"},"links":{"cited_paper":"/paper/2411.02193","citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:9266883b2940bc1c76ece314b350c0eed27680185539cc3080e8cec3097ef19b","observation_id":"f56b1e10-1f41-4f71-83e1-b1bb8170c523","resolution":{"observed_at":"2026-08-15T15:40:27.580176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16560","last_updated":"2026-07-07T00:22:17Z","snapshot_observed_at":"2026-08-17T23:11:51.885297Z","submitted_at":"2025-08-22T17:26:33Z","title":"Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16560","snapshot_observed_at":"2026-08-15T15:40:27.584739Z","title":"Sparse but wrong: Incorrect L0 leads to incorrect features in sparse autoencoders.arXiv preprint arXiv:2508.16560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.584739Z"},"links":{"cited_paper":"/paper/2508.16560","citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:d644d79357222ce98a95506d1b2741fc9ae17f5b42319476b887fb8e9d0929e0","observation_id":"ae5621bf-2ff7-4fb1-81f8-e70b7b795ef8","resolution":{"observed_at":"2026-08-15T15:40:27.584739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.325680Z","title":"A is for absorption: Studying feature splitting and absorption in sparse autoencoders, 2024","venue":null,"work_id":"51e1e881-3b3a-4c9c-b41b-ceb04eb902fd","year":2024},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.589416Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:dd8ca98eaf86468dc246c2820fced84a053b6c99190de37da0da28074ede8737","observation_id":"e07126c9-a1dc-41df-b022-981aeb867eac","resolution":{"observed_at":"2026-08-15T15:40:28.329969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.311989Z","title":"GitHub Code dataset","venue":null,"work_id":"064dc795-f9b7-4f00-9aa7-a65eebb988b0","year":2022},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.593209Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:35d3a7683e5a05e54faf6c4ac9913942e06a95853bc552c0ac9c92e30e181915","observation_id":"3b1ef15a-4b23-40e1-b7dd-a3812998721f","resolution":{"observed_at":"2026-08-15T15:40:28.315903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.298618Z","title":"Sparse autoencoders find highly interpretable features in language models","venue":null,"work_id":"e0db6ba7-131e-450f-a47f-99b81bfc88b4","year":2024},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.597168Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:c99389a25b955477121d11106b453735e211b57e526506aaf03dfae0046480f7","observation_id":"e35d06a0-8b33-4cba-abf7-1a03c349565f","resolution":{"observed_at":"2026-08-15T15:40:28.302703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:27.601068Z","title":"Wikimedia downloads","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.601068Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:5a18a0c6bc65b499bd3e7a4a1fcad0591721ad862acaf5846c0a85ca2036d41c","observation_id":"17051944-f72f-431d-bc3f-8b51532c7a39","resolution":{"observed_at":"2026-08-15T15:40:27.601068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.276556Z","title":"The pile: An 800gb dataset of diverse text for language modeling, 2020","venue":null,"work_id":"4b60b1de-6715-45e2-a701-abdfb71301f3","year":2020},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.604937Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:2d58c1e3429e239eb10cd5a23fba351611bff2fd11bfcdbd6ff1a62d89158729","observation_id":"6297f170-8a63-4fa6-85b6-ff2d6ad123a5","resolution":{"observed_at":"2026-08-15T15:40:28.280432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:27.608736Z","title":"Scaling and evaluating sparse autoencoders","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.608736Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:653e9a6f88b1fc886015fb78f628cee3add826406ca76afc187f00b898a62921","observation_id":"0fbfe632-ccda-41e1-bd6e-251bb21448e2","resolution":{"observed_at":"2026-08-15T15:40:27.608736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.252782Z","title":"Apertus: Democratizing open and compliant LLMs for global language environments, 2025","venue":null,"work_id":"fc3ca94f-a358-4dd8-ad3c-055819635c46","year":2025},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.613077Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:b4a65f580784866762e5fbe8b1d95b0ae1869676cf0c6a7d0ac59b2b2092420e","observation_id":"d84049c3-301d-4c0e-a920-da98c0da9c52","resolution":{"observed_at":"2026-08-15T15:40:28.257161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.239057Z","title":"Open source automated interpretability for sparse autoencoder features","venue":null,"work_id":"78fe4894-c6a1-4d0f-9a3a-fb7fe5d3276e","year":2024},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.616959Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:16385dcdbbdc0cc8f0c95222c393bb0d4c5c2608282b8bfae5e6f2d872728325","observation_id":"df779e8f-9b3b-458c-978a-923652d03c3f","resolution":{"observed_at":"2026-08-15T15:40:28.243501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.226339Z","title":"Are sparse autoencoders useful? a case study in sparse probing","venue":null,"work_id":"a6dc51fd-6960-473a-9694-61c35453feeb","year":2025},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.620615Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:8b464dcc882da6e312fb694f35667d7eaab0b0ab874bd560d6e72bef82804ad5","observation_id":"69f21c61-a0b1-43c3-a85e-c0a35d17b2a2","resolution":{"observed_at":"2026-08-15T15:40:28.230328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.211763Z","title":"SAEBench: A comprehensive benchmark for sparse autoencoders in language model interpretability","venue":null,"work_id":"c6ede191-da87-4e84-8bda-2b5ca49635ba","year":2025},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.624158Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:a58e96bea930cb2315a3f44d5cc0bb4feed115079044c340b1fd75287f533a3d","observation_id":"f43aca0f-b6b4-4393-be30-829f3b120907","resolution":{"observed_at":"2026-08-15T15:40:28.216544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.197443Z","title":"A guideline of selecting and reporting intraclass correlation coefficients for reliability research.Journal of chiropractic medicine, 15(2):155–163, 2016","venue":null,"work_id":"5b902347-392a-4a8b-ba2e-ac5a8b348ebe","year":2016},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.627699Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:9029e6adffae0546ff010281d4903377abe518b7cace6596efa296ca24e3a1a5","observation_id":"2f3d4cca-dab2-40ec-9d04-ae93178bf7f2","resolution":{"observed_at":"2026-08-15T15:40:28.201654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:27.631351Z","title":"Sanity checks for sparse autoencoders: Do saes beat random baselines?arXiv preprint arXiv:2602.14111, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.631351Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:d74714fdd865842835fe44f0b35a1d67bb5fdef850271a9fcca51df0080b6f92","observation_id":"07f91b51-f27d-4f21-bb00-7538f3bce9c7","resolution":{"observed_at":"2026-08-15T15:40:27.631351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.183733Z","title":"A stability index for feature selection","venue":null,"work_id":"bba3cd1a-8d68-4de6-a616-33f64b7fb96c","year":2007},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.635067Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:5b95995438a08e3797167d99d724a802061dcbe07ed18613ad32a04e13fd0dcd","observation_id":"941be90c-aee5-4684-ac00-8d9f429c9e64","resolution":{"observed_at":"2026-08-15T15:40:28.188387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.170218Z","title":"Li, Suraj Srinivas, Usha Bhalla, and Himabindu Lakkaraju","venue":null,"work_id":"5e058e7e-7ae4-4a89-9169-28e9b0b656cc","year":2026},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.638852Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:c79cd02f62d9e6c4bf8bba5c271dd2e72914a9ad1ab45263bb539d8c1607ff8c","observation_id":"fbdc88b6-edff-4d4a-a9ae-5c4c3aa67218","resolution":{"observed_at":"2026-08-15T15:40:28.174309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.156736Z","title":"Intraclass correlation–a discussion and demonstration of basic features.PloS one, 14(7):e0219854, 2019","venue":null,"work_id":"14158550-ec08-4f81-b1d9-726ca8ba7311","year":2019},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.643089Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:7e95e91b2f0ec7f45bbdfac63ca68ce3b56104308369c3a91b172f5dff722310","observation_id":"e503bf00-f334-4dcb-818a-7cb8685d4842","resolution":{"observed_at":"2026-08-15T15:40:28.160935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.142135Z","title":"Towards principled evaluations of sparse autoencoders for interpretability and control","venue":null,"work_id":"ee876d39-d474-4f9c-8b32-ca33971524f2","year":2025},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.646847Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:96eef474d061d62fb70df4dd25b7794edc0c4c8e45741158ac5de144605fa37b","observation_id":"bcd7eeb3-eda2-4972-8f47-f6f34e51b835","resolution":{"observed_at":"2026-08-15T15:40:28.147104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:27.650368Z","title":"Sparse feature circuits: Discovering and editing interpretable causal graphs in language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.650368Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:f7ce48dc12599c09525ef09a1637e38a9b279d61df8211d9cd975cf787483ad2","observation_id":"9abdb850-490a-41fd-bdd4-7c303b55324d","resolution":{"observed_at":"2026-08-15T15:40:27.650368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.118260Z","title":"Rethinking evaluation of sparse autoencoders through the representation of polysemous words","venue":null,"work_id":"7ca4045f-2db4-404b-ad18-d4b9034e4b32","year":2025},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.653931Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:d2bc31f1be4a593cf48869d8e714b24ddfb34c2c4c2fc6dd9dddf9cba3a3d5d6","observation_id":"7936250f-5973-4139-9eb9-f950b8c4b1ec","resolution":{"observed_at":"2026-08-15T15:40:28.122513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.103988Z","title":null,"venue":null,"work_id":"e3a930fa-51e5-4eeb-b9a3-6591e5da2617","year":2024},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.657395Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:bf6638be83c354c49faed19cca786c0993f451e57c20f5e0ceefa5389cb69ef6","observation_id":"ae537b66-192e-4713-aea7-beacc0a34a3e","resolution":{"observed_at":"2026-08-15T15:40:28.108417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.089713Z","title":"Sparse autoencoders trained on the same data learn different features","venue":null,"work_id":"cf5f8b4d-051b-4244-908b-bb8ea6b45565","year":2026},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.661377Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:6dcd4dbfe5dbef1784b1f563bf8bc542d5434d1ae444a037b700b2438d5aa8a3","observation_id":"4829db98-393d-4bd4-ab38-b952ceef7d61","resolution":{"observed_at":"2026-08-15T15:40:28.094034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.075889Z","title":"Automatically interpreting millions of features in large language models","venue":null,"work_id":"5978ef41-e723-4ebf-90a1-5a29f3d11d04","year":2025},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.665065Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:08242077bec8de5a45bf78fee0163ac01897d814eca13acd6ee2ac5481d531f2","observation_id":"9862a3fe-97a4-4dd2-a0cf-f378896bab05","resolution":{"observed_at":"2026-08-15T15:40:28.080121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.061797Z","title":"FADE: Why bad descriptions happen to good features","venue":null,"work_id":"e26bf71a-498b-4b09-9ffe-bc33880ee1a9","year":2025},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.669154Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:b1bf9402a50825dd59110e693de768b979d724be4404f0ca6da90e9070b77020","observation_id":"7acceead-2e40-473e-b227-6e4aa46a417f","resolution":{"observed_at":"2026-08-15T15:40:28.065957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:27.673178Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.673178Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:7209b95a12369c0eac65406b3f08d5e696f34eb3f5e9c9240083425d40e4712a","observation_id":"773388a2-99ce-4343-8bc0-458daedca425","resolution":{"observed_at":"2026-08-15T15:40:27.673178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.038216Z","title":"Improving sparse decomposition of language model activations with gated sparse autoencoders","venue":null,"work_id":"d06152d3-7762-4ea1-8ffd-57dd9ac4d9cf","year":2024},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.676963Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:d56a43f3f5400ee12f192cdb13f3c76d2e0add001d8a15603f36fbab39048690","observation_id":"babfafae-fa97-441f-885f-883a5bf48692","resolution":{"observed_at":"2026-08-15T15:40:28.042878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.025182Z","title":"Sullivan and Richard Feinn","venue":null,"work_id":"d94763ee-61f8-4cb7-815d-5d781ff901b6","year":2012},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.680935Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:c2c1352a7fccc871ec0c02b0fa3e59bac0532039cfa534d49e234d3702b8a013","observation_id":"c81f4395-718f-4dea-95ed-a0c3aabb5590","resolution":{"observed_at":"2026-08-15T15:40:28.029064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:28.010860Z","title":null,"venue":null,"work_id":"59c8e4ca-80c3-48f7-9d02-27c927170613","year":2024},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.684936Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:a3691c712f7547849f321f0172dcce928f5f74aa8e70bcbb23758899f8d00496","observation_id":"e490a44f-dc28-45d7-aafc-7293adcdade6","resolution":{"observed_at":"2026-08-15T15:40:28.014963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:27.996676Z","title":"Daniel Freeman, Theodore R","venue":null,"work_id":"5cd83d63-2f99-4e3b-bab4-7a3a5ab881e3","year":2024},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.689798Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:764efeb3fd7ab9fb61d5f737bbfd8a3988766615259b4dab350c50f6b5ede49c","observation_id":"adcb075c-e4fd-4787-ab96-6727b882271c","resolution":{"observed_at":"2026-08-15T15:40:28.000854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:27.693496Z","title":"Persona features control emergent misalignment.arXiv preprint arXiv:2506.19823, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.693496Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:12dff5ecfb9948e929aa133cb09acbef702320489dd4725857828574471880db","observation_id":"ae010ecc-adc9-482c-9391-9ba0a4ddaed4","resolution":{"observed_at":"2026-08-15T15:40:27.693496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:27.983632Z","title":"Axbench: Steering LLMs? even simple base- lines outperform sparse autoencoders","venue":null,"work_id":"11b964f8-779b-433f-87f9-590d0268e58f","year":2025},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.696938Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:3c93c4191f91f9c40a7b070ec502c19f12409d5444bf84a4cf2a8f0257c312a4","observation_id":"f6b05b1f-4c5c-4752-9b62-a6b667d40285","resolution":{"observed_at":"2026-08-15T15:40:27.987829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:27.970051Z","title":"Mathematical equations and formulas","venue":null,"work_id":"e9e12988-af4f-43ce-aa9d-d7cf7a4ce733","year":2020},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.700584Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:e7fa9c2e30e1bbdc0611b60b70d501fe78db33ee2492530c8d0b670969f7dcde","observation_id":"bb8e841d-c233-42a9-94ba-17ae32439ac2","resolution":{"observed_at":"2026-08-15T15:40:27.974427Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:40:27.954408Z","title":"Justification: There is no crowdsourcing nor research with human subjects","venue":null,"work_id":"5cdf6696-1459-4056-acdf-566aa54f2364","year":null},"citing_paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:40:27.706679Z"},"links":{"citing_paper":"/paper/2607.19386"},"observation_digest":"sha256:825ab7ef44a45e810a7da559ecaf0688f7c4874ac2095f28637e6d79953d00af","observation_id":"3ad60b9a-5913-4bcd-be77-d0b748173032","resolution":{"observed_at":"2026-08-15T15:40:27.960201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.19386","last_updated":"2026-07-01T13:18:12Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T23:12:37.135559Z","submitted_at":"2026-07-01T13:18:12Z","title":"Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2607.19386."}