{"as_of":"2026-08-08T21:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ddeae922649cc504756db91201e61b48e89ec77993dcabbdcfd09623da70cf1d","coverage":[{"denominator":91,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:06:56.135403Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:01:59.215909Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T23:02:04.281602Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"cited_work":{"arxiv_id":"2502.05242","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.05242","snapshot_observed_at":"2026-08-05T23:02:04.281602Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","venue":"cs.CL","work_id":"c2e31a45-6fb4-4b67-a308-a96d7775593d","year":2025},"citing_paper":{"arxiv_id":"2508.06017","last_updated":"2025-08-08T05:04:47Z","snapshot_observed_at":"2026-08-08T10:44:52.352035Z","submitted_at":"2025-08-08T05:04:47Z","title":"Position: Intelligent Coding Systems Should Write Programs with Justifications","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:01:59.215909Z"},"links":{"cited_paper":"/paper/2502.05242","citing_paper":"/paper/2508.06017"},"observation_digest":"sha256:72e7a6709cf86ac29ad767d4c47dfa911b58c0739eb7d73b8cff1054062427bb","observation_id":"0bdfb9f2-0a78-4996-bd33-6a36b60098b2","resolution":{"observed_at":"2026-08-05T23:02:04.284765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05242/citation-record","integrity":"/paper/2502.05242/integrity","json":"/paper/2502.05242/citation-record.json","paper":"/paper/2502.05242"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.07755","last_updated":"2023-09-14T14:41:46Z","snapshot_observed_at":"2026-07-06T16:18:29.465282Z","submitted_at":"2023-09-14T14:41:46Z","title":"Generative AI Text Classification using Ensemble LLM Approaches","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07755","snapshot_observed_at":"2026-08-08T21:06:55.774507Z","title":"Generative ai text classification using ensemble llm approaches","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.774507Z"},"links":{"cited_paper":"/paper/2309.07755","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:3ba16567c4e7ac52ad8f6fe47d31fdcc57d5a4ad5b51c7a3791a36c4a54d9a4a","observation_id":"f3e8f967-b44d-4ec1-bfce-2738e74c1b1f","resolution":{"observed_at":"2026-08-08T21:06:55.774507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T21:06:55.779567Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.779567Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:8a7becdf2dc08270dc6b2d29ce0b97d5c12056e7da84bba53b1a7e3295fffe0e","observation_id":"e63ebdc5-3aad-4860-8b8c-4fcc8b8591fb","resolution":{"observed_at":"2026-08-08T21:06:55.779567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13734","last_updated":"2023-10-17T09:34:30Z","snapshot_observed_at":"2026-08-01T19:59:13.992395Z","submitted_at":"2023-04-26T02:49:38Z","title":"The Internal State of an LLM Knows When It's Lying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13734","snapshot_observed_at":"2026-08-08T21:06:55.783768Z","title":"The internal state of an llm knows when it’s lying","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.783768Z"},"links":{"cited_paper":"/paper/2304.13734","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:a28784fc8452b74b33c9ff1e53864261299f345d45d2df9b678a863f285fe71f","observation_id":"a0e013a8-1d8a-4685-8774-759eba133331","resolution":{"observed_at":"2026-08-08T21:06:55.783768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.788132Z","title":"Transparency and explainability of ai systems: ethical guidelines in practice","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.788132Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:70bb8a0ec6449b286548a1f345b50f44be20f30bdce67c00c86fe7063f760079","observation_id":"457ddc55-500e-4a0c-be87-d9b5acc5e94d","resolution":{"observed_at":"2026-08-08T21:06:55.788132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.792115Z","title":"Spectrally-normalized margin bounds for neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.792115Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:9c8ba2dafa8bd51f961db205148f0f14d32e7587fc84452430d0cfc689607e90","observation_id":"b937a963-1c1c-4573-bf94-74451f211016","resolution":{"observed_at":"2026-08-08T21:06:55.792115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.796051Z","title":"Language models can explain neurons in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.796051Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:347b6ba09485cce51389b6c9e235e251cf332a07feacf9da4c318b9dac052d76","observation_id":"dd51a220-ef09-4d7a-aed8-ca8c6dcd3fca","resolution":{"observed_at":"2026-08-08T21:06:55.796051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07900","last_updated":"2025-03-25T22:02:36Z","snapshot_observed_at":"2026-08-05T00:06:48.208467Z","submitted_at":"2024-04-11T16:39:00Z","title":"High-Dimension Human Value Representation in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07900","snapshot_observed_at":"2026-08-08T21:06:55.800491Z","title":"High-dimension human value representation in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.800491Z"},"links":{"cited_paper":"/paper/2404.07900","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:c1636175e79963b723c8f798ecbd71104346a3815180614f666f100e0ac9564a","observation_id":"eff633a2-2ed4-4a3e-9fb4-c940d9671e89","resolution":{"observed_at":"2026-08-08T21:06:55.800491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.804422Z","title":"Internlm2 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.804422Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:6db0f65a37623c9f58bd270b6faea2c2cfa6acadfe5ff8509e441bed264dbe24","observation_id":"8f4e9428-e1ba-410b-b894-69a5806bac97","resolution":{"observed_at":"2026-08-08T21:06:55.804422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.808319Z","title":"Redunet: A white-box deep network from the principle of maximizing rate reduction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.808319Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:02d22f02f5701b193504163f36798aa5a01190cc0a97747b5ce277d9e91a0708","observation_id":"b4f9efca-d4c3-4300-863c-4cf5ea4377c2","resolution":{"observed_at":"2026-08-08T21:06:55.808319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10949","last_updated":"2024-03-26T01:15:09Z","snapshot_observed_at":"2026-07-06T17:45:43.726336Z","submitted_at":"2024-03-16T15:30:34Z","title":"SelfIE: Self-Interpretation of Large Language Model Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10949","snapshot_observed_at":"2026-08-08T21:06:55.812069Z","title":"Selfie: Self-interpretation of large language model embeddings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.812069Z"},"links":{"cited_paper":"/paper/2403.10949","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:868be87f044a731c485df8a0a17e44133cbe263c7b692df561647c8254b328c5","observation_id":"ae97825f-34b0-4041-aa53-5e11bac06f2d","resolution":{"observed_at":"2026-08-08T21:06:55.812069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.815963Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.815963Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:f6e06f6d2809b0e534823118912873d3f920d6b0a7fe9e677eaeac1390969b5e","observation_id":"65862f5e-6e05-4c89-8962-8c35adb1434c","resolution":{"observed_at":"2026-08-08T21:06:55.815963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-07-06T21:21:01.070459Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-08T21:06:55.819737Z","title":"Reasoning models don’t always say what they think","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.819737Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:866a9f19042caf0eba3c3f593cbb1dfd0e118e60f4c7021a329432782a6431f6","observation_id":"b0d84af8-53d5-4908-8fbe-29a7d337e092","resolution":{"observed_at":"2026-08-08T21:06:55.819737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08723","last_updated":"2023-11-15T06:33:52Z","snapshot_observed_at":"2026-08-03T17:34:01.015060Z","submitted_at":"2023-11-15T06:33:52Z","title":"Token Prediction as Implicit Classification to Identify LLM-Generated Text","version":1},"cited_work":{"arxiv_id":"2311.08723","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.08723","snapshot_observed_at":"2026-08-08T21:06:56.902649Z","title":"Token Prediction as Implicit Classification to Identify LLM-Generated Text","venue":"cs.CL","work_id":"beb31aac-dece-43ce-a301-477e2a16d68e","year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.823842Z"},"links":{"cited_paper":"/paper/2311.08723","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:db58ff6d62874f786fc97b10eac5f15f20c12e3b777df11ef3210774617d62c7","observation_id":"b3eb7f9c-41eb-4d33-8e1b-1c3bb0803fbc","resolution":{"observed_at":"2026-08-08T21:06:56.907064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.827723Z","title":"Measuring generalization with optimal transport","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.827723Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:511d3d329d98a4a94e446ef3b8556c03d825e55f17dae9fbc5d712431a123d14","observation_id":"5939e0aa-5dd2-4819-87c4-6cee38a1f6ef","resolution":{"observed_at":"2026-08-08T21:06:55.827723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-08T21:06:55.831386Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.831386Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:0b89daf4268b48401bb3f9f0b8c0040912b552db7a08a2bf0d3d678b06e971b1","observation_id":"501c34ff-aac9-4645-b297-50d7bd509842","resolution":{"observed_at":"2026-08-08T21:06:55.831386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.835382Z","title":"Opencompass: A universal evaluation platform for foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.835382Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:ec46cd28a12cfe95548b038b9e18114f2a1134350c2885f802ed5bd4e08db9a2","observation_id":"6f210b8b-a74b-4846-8cc4-0969bdab1572","resolution":{"observed_at":"2026-08-08T21:06:55.835382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02104","last_updated":"2024-12-03T02:54:31Z","snapshot_observed_at":"2026-07-06T20:00:37.331726Z","submitted_at":"2024-12-03T02:54:31Z","title":"Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02104","snapshot_observed_at":"2026-08-08T21:06:55.839319Z","title":"Explainable and interpretable multimodal large language models: A comprehensive survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.839319Z"},"links":{"cited_paper":"/paper/2412.02104","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:80add8c2fcabddbf5d2b97f0907bdcb0679f8a4a9f521e4a4162d7e63e9ec67d","observation_id":"a558fa4f-2a39-4149-80df-bd468a5a5042","resolution":{"observed_at":"2026-08-08T21:06:55.839319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-08T21:06:55.843649Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.843649Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:57cf928eb209b2b36e6cf90caec6c3c23965f7f82649497f7e751f46d5a1b5e0","observation_id":"a712fe56-9fc0-4031-9daf-03316b48d32b","resolution":{"observed_at":"2026-08-08T21:06:55.843649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T21:06:55.848017Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.848017Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:3365be50ad01be10d14e74d9685ee8f2247a33774eb6c393dc967601691f679e","observation_id":"5e02df84-da1c-4178-a019-39ed782397c8","resolution":{"observed_at":"2026-08-08T21:06:55.848017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04093","last_updated":"2024-06-06T14:10:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-06T14:10:12Z","title":"Scaling and evaluating sparse autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04093","snapshot_observed_at":"2026-08-08T21:06:55.852430Z","title":"Scaling and evaluating sparse autoencoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.852430Z"},"links":{"cited_paper":"/paper/2406.04093","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:e1510f1260b66ac6e2ba8dc4ff6be7199292ca8c093b9193756e1aa92b981d17","observation_id":"80e24131-ca75-4d12-947c-9c2e86df1e54","resolution":{"observed_at":"2026-08-08T21:06:55.852430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06102","last_updated":"2024-06-06T22:59:58Z","snapshot_observed_at":"2026-08-08T01:23:42.996552Z","submitted_at":"2024-01-11T18:33:48Z","title":"Patchscopes: A Unifying Framework for Inspecting Hidden Representations of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06102","snapshot_observed_at":"2026-08-08T21:06:55.856894Z","title":"Patchscope: A unifying framework for inspecting hidden representations of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.856894Z"},"links":{"cited_paper":"/paper/2401.06102","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:83d2ab6c9e3ee47111dfcb91bee6b3f2517bc8d3819e6a43039f85ff54a4e65d","observation_id":"0b6e1392-4cdc-4298-9c06-0f4bd94eaef8","resolution":{"observed_at":"2026-08-08T21:06:55.856894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-08T21:06:55.861230Z","title":"Alignment faking in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.861230Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:eadddc824e5523ee82fb80f9f7e6cc92ac884e9252f803dd8911580690e1fa48","observation_id":"0187d06a-8394-441e-9bb2-d9e927e54d26","resolution":{"observed_at":"2026-08-08T21:06:55.861230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.865542Z","title":"Dimensionality reduction by learning an invariant mapping","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.865542Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:e4bdccfe35ec129ce237dd847f575febc3a20082cdd9959c96ac4c4b201d0304","observation_id":"b469aef6-7e91-495f-ad40-23df6a2e9795","resolution":{"observed_at":"2026-08-08T21:06:55.865542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.869642Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.869642Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:cf080dca72e40576755e408a39341509a98545acb254aea3f6ef5c66be13b7d0","observation_id":"b0fa4ebb-603c-496e-b878-aafe3fdfd14b","resolution":{"observed_at":"2026-08-08T21:06:55.869642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.873475Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.873475Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:60417ea2c4ab1958934c468790b07fa19bb6993fda97c6db57a342ebda1ac9c8","observation_id":"e4bcd3c8-ce88-43ee-8aff-f1ca7ead4c4c","resolution":{"observed_at":"2026-08-08T21:06:55.873475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-08T21:06:55.877048Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.877048Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:5b7482136cb7dea7d2a29e0a1daa5dbef986f651336780d489dac1864cdaed4b","observation_id":"688d65ed-4bff-4110-a7af-35d28a44760d","resolution":{"observed_at":"2026-08-08T21:06:55.877048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.880776Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.880776Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:4b1204dcf212c36323efc8035d901e004c7ad49df6a1bdb4a7fda3a6ce21f691","observation_id":"b175704b-317e-4612-ad96-c1a7e576cdfc","resolution":{"observed_at":"2026-08-08T21:06:55.880776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T21:06:55.884405Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.884405Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:29f91f14f7a92a115cc56b1162e4fabf07685dfac1f12e97450280a91b56b548","observation_id":"f7ac45f8-93e2-4db4-8b6e-513633c2f52a","resolution":{"observed_at":"2026-08-08T21:06:55.884405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.888220Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.888220Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:ab36568995758e9adb7639803bb35b141c56350685bf82e2a52dc8ee4d16323b","observation_id":"f2ff69cd-e2d8-495a-bf29-c5ad0093834c","resolution":{"observed_at":"2026-08-08T21:06:55.888220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11207","last_updated":"2023-10-17T12:34:32Z","snapshot_observed_at":"2026-08-07T08:04:01.104100Z","submitted_at":"2023-10-17T12:34:32Z","title":"Can Large Language Models Explain Themselves? A Study of LLM-Generated Self-Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11207","snapshot_observed_at":"2026-08-08T21:06:55.891758Z","title":"Can large language models explain themselves? a study of llm-generated self-explanations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.891758Z"},"links":{"cited_paper":"/paper/2310.11207","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:4b9b04018a318bea1e2662a0ede5acab1bc23aa6af745925f78e7b6ea8fdeab0","observation_id":"173d7867-b738-4c0a-9787-e087706fc231","resolution":{"observed_at":"2026-08-08T21:06:55.891758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01109","last_updated":"2024-11-24T20:09:55Z","snapshot_observed_at":"2026-07-06T17:24:03.237617Z","submitted_at":"2024-02-02T02:56:50Z","title":"Vaccine: Perturbation-aware Alignment for Large Language Models against Harmful Fine-tuning Attack","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01109","snapshot_observed_at":"2026-08-08T21:06:55.895736Z","title":"Vaccine: Perturbation-aware alignment for large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.895736Z"},"links":{"cited_paper":"/paper/2402.01109","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:8a7a17b00a6a926f1552e4dc5b379b5c4bd4e913989796a6d6f77e871ba5f9ea","observation_id":"10957a03-58f7-494b-875c-b555402d289d","resolution":{"observed_at":"2026-08-08T21:06:55.895736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.328584Z","title":"Anthropic: Responsible scaling policy","venue":null,"work_id":"d42dbce4-b280-4118-839a-b245c63b6661","year":2025},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.899620Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:d2b728520375b27f7ebd7eb410721eabff92d892fa782f895967ce7577d77f21","observation_id":"c35dd0db-4a15-410d-8ace-4a2453be7f10","resolution":{"observed_at":"2026-08-08T21:06:57.332762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-06T11:02:06.607024Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07987","snapshot_observed_at":"2026-08-08T21:06:55.903599Z","title":"The platonic representation hypothesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.903599Z"},"links":{"cited_paper":"/paper/2405.07987","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:42c0b4d69300644b97a3f93296d693e60e9c7d4ced88d5744ff2f5eb33a9df34","observation_id":"5e83a56d-4123-4e6b-b529-66b410741f27","resolution":{"observed_at":"2026-08-08T21:06:55.903599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.314505Z","title":"Klanderman, and William J Rucklidge","venue":null,"work_id":"f56b3d7e-3e31-4cae-8057-44eb62949792","year":1993},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.907611Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:91622beb4e1f665c7758ad747bcc483624f4e0b72ee254fbc21e80c0354dc881","observation_id":"83447c0a-c73c-4565-8128-9ab08938f379","resolution":{"observed_at":"2026-08-08T21:06:57.318683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-07-06T17:00:00.321552Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-08T21:06:55.911523Z","title":"Llama guard: Llm-based input-output safeguard for human-ai conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.911523Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:8875b34bddd970e3e780715c4f74869d5b0ac740be7f877b497c6ef32489de6c","observation_id":"a4e41a44-f263-41ee-84a9-6447e16b6d3b","resolution":{"observed_at":"2026-08-08T21:06:55.911523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.915594Z","title":"Beavertails: Towards improved safety alignment of llm via a human-preference dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.915594Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:45bbe6f7bb85ef46a2c6fa592158979ff59b1a93e88c5902e81066cc833fb576","observation_id":"70aa9370-bc40-4292-9e1d-49f62f31b051","resolution":{"observed_at":"2026-08-08T21:06:55.915594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-08T21:06:55.919286Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.919286Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:78ea6686bf76c0555ebbc639d90ceac5237d65faba0631d325a1808e4d2ea96c","observation_id":"adcf540f-b082-4a3e-8918-95a7bd6c7d59","resolution":{"observed_at":"2026-08-08T21:06:55.919286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.07976","last_updated":"2020-12-14T22:21:37Z","snapshot_observed_at":"2026-08-08T18:35:27.163013Z","submitted_at":"2020-12-14T22:21:37Z","title":"NeurIPS 2020 Competition: Predicting Generalization in Deep Learning","version":1},"cited_work":{"arxiv_id":"2012.07976","doi":null,"metadata_source":"pith","pith_arxiv_id":"2012.07976","snapshot_observed_at":"2026-08-08T21:06:56.678827Z","title":"NeurIPS 2020 Competition: Predicting Generalization in Deep Learning","venue":"cs.LG","work_id":"a3e22d97-1f21-49d6-8b75-367e89527854","year":2020},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.923429Z"},"links":{"cited_paper":"/paper/2012.07976","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:a08312dc3b047b8505a1198322293d31b75ed89ec2403ad6f2c4b6e5a6f2cb3e","observation_id":"d035885d-8c60-4038-ad07-fdf4cbde629f","resolution":{"observed_at":"2026-08-08T21:06:56.683476Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.290890Z","title":"Explainable artifi- cial intelligence for mental health through transparency and interpretability for understandability","venue":null,"work_id":"9aa0ecde-43d6-423c-8675-16a42ac96554","year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.927512Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:bd5a08ceda338b9ef87df79a9e48779da9726362f62bd4e17d5d14f691966023","observation_id":"13866d13-644a-4719-b597-dc36bef6e648","resolution":{"observed_at":"2026-08-08T21:06:57.295179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16043","last_updated":"2024-05-25T03:48:12Z","snapshot_observed_at":"2026-07-31T09:15:59.099560Z","submitted_at":"2024-05-25T03:48:12Z","title":"Theoretical Analysis of Weak-to-Strong Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16043","snapshot_observed_at":"2026-08-08T21:06:55.931312Z","title":"Theoretical analysis of weak-to- strong generalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.931312Z"},"links":{"cited_paper":"/paper/2405.16043","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:629765623755e281b994658115cb8861120e71086a472580d29536ec26c8be3e","observation_id":"ae57fff5-306c-420d-9be1-75a143f4fa31","resolution":{"observed_at":"2026-08-08T21:06:55.931312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17888","last_updated":"2024-10-27T20:09:59Z","snapshot_observed_at":"2026-07-06T18:21:05.410042Z","submitted_at":"2024-05-28T07:11:05Z","title":"Getting More Juice Out of the SFT Data: Reward Learning from Human Demonstration Improves SFT for LLM Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17888","snapshot_observed_at":"2026-08-08T21:06:55.935526Z","title":"Getting more juice out of the sft data: Reward learning from human demonstration improves sft for llm alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.935526Z"},"links":{"cited_paper":"/paper/2405.17888","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:872798aac2fcb9abffceab18816c5f19823471b27a6276091d92792931042c99","observation_id":"e56eae66-2a65-4723-84a4-b2a9ea64b870","resolution":{"observed_at":"2026-08-08T21:06:55.935526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.277493Z","title":"Inference- time intervention: Eliciting truthful answers from a language model","venue":null,"work_id":"2afb8aea-a291-4aa7-9960-ad9f79d2d948","year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.939591Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:5d895b1de9ab23a4f2d4951b0bc85a4ed56f9b2c996f51766b1d214d97758147","observation_id":"4ff0e8ae-7aed-43ef-b4ef-f79cf43fff2e","resolution":{"observed_at":"2026-08-08T21:06:57.281700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05044","last_updated":"2024-06-07T12:05:46Z","snapshot_observed_at":"2026-08-03T21:40:53.683032Z","submitted_at":"2024-02-07T17:33:54Z","title":"SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05044","snapshot_observed_at":"2026-08-08T21:06:55.943327Z","title":"Salad-bench: A hierarchical and comprehensive safety benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.943327Z"},"links":{"cited_paper":"/paper/2402.05044","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:963b81bccdd9344f9d6d9342c0bf595918b77278b21109686b7278f0709bf451","observation_id":"3b5c0a1c-1092-451e-abaf-5fcbafeda044","resolution":{"observed_at":"2026-08-08T21:06:55.943327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03218","last_updated":"2024-05-15T19:16:09Z","snapshot_observed_at":"2026-08-05T08:49:32.502826Z","submitted_at":"2024-03-05T18:59:35Z","title":"The WMDP Benchmark: Measuring and Reducing Malicious Use With Unlearning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03218","snapshot_observed_at":"2026-08-08T21:06:55.947697Z","title":"The wmdp benchmark: Measuring and reducing malicious use with unlearning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.947697Z"},"links":{"cited_paper":"/paper/2403.03218","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:7541b97c6e0a94c0585c13c3bc15d4d78ee491b743fcea1d61c5e7d4c305c527","observation_id":"91f68183-74c7-4e22-bd63-d35465225cf9","resolution":{"observed_at":"2026-08-08T21:06:55.947697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06824","last_updated":"2025-02-21T05:17:52Z","snapshot_observed_at":"2026-07-06T17:14:57.853205Z","submitted_at":"2024-01-12T00:50:04Z","title":"Revisiting Jailbreaking for Large Language Models: A Representation Engineering Perspective","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06824","snapshot_observed_at":"2026-08-08T21:06:55.952238Z","title":"Open the pandora’s box of llms: Jailbreak- ing llms through representation engineering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.952238Z"},"links":{"cited_paper":"/paper/2401.06824","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:2a957a93e78ef8fd6300374e3f0c3ea4dba103993f019a9de2570827c5a0f3cd","observation_id":"20f0ad26-1ff9-4a3a-8c07-5e261d86327f","resolution":{"observed_at":"2026-08-08T21:06:55.952238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.956497Z","title":"Large language models in finance: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.956497Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:e1b58360e0daa92ffa9990aa273741a6aae0282d361c2723af4e4e43b7048858","observation_id":"8ce0c3e3-8ff9-4f56-949e-5081cf4e12d3","resolution":{"observed_at":"2026-08-08T21:06:55.956497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05147","last_updated":"2024-08-19T07:51:05Z","snapshot_observed_at":"2026-08-04T11:44:14.524984Z","submitted_at":"2024-08-09T16:06:42Z","title":"Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05147","snapshot_observed_at":"2026-08-08T21:06:55.960754Z","title":"Gemma scope: Open sparse autoencoders everywhere all at once on gemma 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.960754Z"},"links":{"cited_paper":"/paper/2408.05147","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:ee867b58e1ac7f5a3eb96aa2032ae1a1d0af02d239cbcf567f3b88c64a7d3827","observation_id":"fa921c34-69a1-4f13-bb2a-16033b96982f","resolution":{"observed_at":"2026-08-08T21:06:55.960754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.254345Z","title":"Latent guard: a safety framework for text-to-image generation","venue":null,"work_id":"ee448399-94ae-4e23-8a6b-3c73f1b575e0","year":2025},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.965090Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:0668d8dd2ec20a53182fc370c7bc5ca37d56a8a2521f329cc7c63482c8a1490b","observation_id":"2fe70bf5-43ea-4c1f-9120-0d1084c5f9b8","resolution":{"observed_at":"2026-08-08T21:06:57.258531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06202","last_updated":"2025-03-08T13:08:46Z","snapshot_observed_at":"2026-08-07T17:20:15.081945Z","submitted_at":"2025-03-08T13:08:46Z","title":"Breaking Free from MMI: A New Frontier in Rationalization by Probing Input Utilization","version":1},"cited_work":{"arxiv_id":"2503.06202","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06202","snapshot_observed_at":"2026-08-08T21:06:56.572557Z","title":"Breaking Free from MMI: A New Frontier in Rationalization by Probing Input Utilization","venue":"cs.AI","work_id":"f5f622bf-f4f1-405d-abfb-45cda3c37773","year":2025},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.969484Z"},"links":{"cited_paper":"/paper/2503.06202","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:0efb6d31009ffb8f807bac0f42c2d8afe24e7c154f8abf99ce24332df1ece263","observation_id":"8a83b41f-745d-483b-9005-e7157117c742","resolution":{"observed_at":"2026-08-08T21:06:56.576746Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06003","last_updated":"2024-10-22T03:30:35Z","snapshot_observed_at":"2026-08-04T23:57:17.634868Z","submitted_at":"2024-10-08T13:04:02Z","title":"Is the MMI Criterion Necessary for Interpretability? Degenerating Non-causal Features to Plain Noise for Self-Rationalization","version":4},"cited_work":{"arxiv_id":"2410.06003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.06003","snapshot_observed_at":"2026-08-08T21:06:56.552852Z","title":"Is the MMI Criterion Necessary for Interpretability? Degenerating Non-causal Features to Plain Noise for Self-Rationalization","venue":"cs.LG","work_id":"8c734364-8800-4f78-b384-b612729475ad","year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.973742Z"},"links":{"cited_paper":"/paper/2410.06003","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:5836efb18986a283d80ca4686434539e42022caecee42fdbdd411eb01e78a9ea","observation_id":"036de2d0-4613-491c-bb9f-b3cc5f5c938a","resolution":{"observed_at":"2026-08-08T21:06:56.558474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04492","last_updated":"2023-07-23T08:54:43Z","snapshot_observed_at":"2026-08-06T05:32:42.810893Z","submitted_at":"2023-05-08T06:36:46Z","title":"MGR: Multi-generator Based Rationalization","version":8},"cited_work":{"arxiv_id":"2305.04492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.04492","snapshot_observed_at":"2026-08-08T21:06:56.532526Z","title":"MGR: Multi-generator Based Rationalization","venue":"cs.LG","work_id":"de043fc2-0087-4477-a9b7-66f9422bdf02","year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.977711Z"},"links":{"cited_paper":"/paper/2305.04492","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:e785771bbb765cb33b0e46f258b331804b7236cd390ce4c1476a48e008d3c42f","observation_id":"a900ae02-3466-4912-8423-ea555e038e6d","resolution":{"observed_at":"2026-08-08T21:06:56.537652Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.240980Z","title":"D-separation for causal self-explanation","venue":null,"work_id":"c082ebd8-8deb-487c-ba43-951721469280","year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.981604Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:e89f004c21e670e15ea67e04f7bf4f1680595cf9262ee9cdab82c40c0b608146","observation_id":"4e06cb80-918d-4863-8234-b1daffbddaf5","resolution":{"observed_at":"2026-08-08T21:06:57.245452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.985225Z","title":"Efficient detection of toxic prompts in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.985225Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:d83af03cbc20d2718c9110f9e47769eca5eda30b50aa523a823e8002a3b20172","observation_id":"df5fed00-963e-4362-b243-b73676f467f7","resolution":{"observed_at":"2026-08-08T21:06:55.985225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.217773Z","title":"Are self-explanations from large language models faithful? In Findings of the Association for Computational Linguistics ACL 2024, pages 295–337, 2024","venue":null,"work_id":"782a25c0-3185-4ef8-aea7-260a36e0cf8b","year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.988861Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:983bb2e386c06b0ddb0be2680663727a5ee9a43c7f1d9bf2cac1338b12d939b7","observation_id":"16164951-f8c2-42c2-95a9-11c2a14fd8e2","resolution":{"observed_at":"2026-08-08T21:06:57.222356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.202331Z","title":"Introducing llama 3.1: Our most capable models to date","venue":null,"work_id":"e2ee1f8b-c215-4bfd-a794-db98b7eefaa5","year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.992591Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:e239d32e879ccee9c1be18569805a8d2f102934d219b46152994bdb40c486a7a","observation_id":"446c31d7-65c7-4a8a-b4c3-89caa757e468","resolution":{"observed_at":"2026-08-08T21:06:57.207161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:55.996095Z","title":"Large language models in healthcare and medical domain: A review","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.996095Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:d4c4a79eb6db9347e942f1a1875a08a0af6792cc381f7ccf257641f098839c90","observation_id":"1d218019-ad92-4d0e-9b10-81277d858604","resolution":{"observed_at":"2026-08-08T21:06:55.996095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.177797Z","title":"interpreting gpt: the logit lens, 2020","venue":null,"work_id":"c9f9617a-9ce7-46a5-a159-23d4e1cc3eb8","year":2020},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:55.999980Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:ba656097e9fbe4dd734c6b162366d72b217fc6b062c1c6d3accc2f856d923a0c","observation_id":"20430a8d-5418-4d9d-9714-48fe056b05aa","resolution":{"observed_at":"2026-08-08T21:06:57.182480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00114","last_updated":"2021-11-30T21:32:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-11-30T21:32:46Z","title":"Show Your Work: Scratchpads for Intermediate Computation with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00114","snapshot_observed_at":"2026-08-08T21:06:56.003552Z","title":"Show your work: Scratchpads for intermediate computation with language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.003552Z"},"links":{"cited_paper":"/paper/2112.00114","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:7114b91703657f50aa0d447eb1c5cb6379151fd5b63f5d44bf5f29dbc7d405d7","observation_id":"225d2322-a4f4-4637-8b8b-803d0835fc56","resolution":{"observed_at":"2026-08-08T21:06:56.003552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-08T21:06:56.007455Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.007455Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:0af055ff9bb800157f5aefd102b6a6bd8da279c21caff0735795cde9fcef3d86","observation_id":"2653e440-a101-4d97-a749-9c18c20fe79a","resolution":{"observed_at":"2026-08-08T21:06:56.007455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02707","last_updated":"2025-05-18T11:18:56Z","snapshot_observed_at":"2026-08-04T21:25:41.967552Z","submitted_at":"2024-10-03T17:31:31Z","title":"LLMs Know More Than They Show: On the Intrinsic Representation of LLM Hallucinations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02707","snapshot_observed_at":"2026-08-08T21:06:56.011274Z","title":"Llms know more than they show: On the intrinsic representation of llm hallucinations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.011274Z"},"links":{"cited_paper":"/paper/2410.02707","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:8e1917c6a025c8da7831d12db9483a0297d397d27c0debf9a09843ffb27142d1","observation_id":"77650200-95ad-4254-ae66-b393f8e2d986","resolution":{"observed_at":"2026-08-08T21:06:56.011274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.015292Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.015292Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:1013e9f80e6595983bfedf6c69cb50ce7e042f297447ec0bb912cdac68d2816c","observation_id":"26f79b94-4509-4a6c-9844-3692db5eff03","resolution":{"observed_at":"2026-08-08T21:06:56.015292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16672","last_updated":"2025-06-03T09:50:57Z","snapshot_observed_at":"2026-07-06T19:37:33.729773Z","submitted_at":"2024-10-22T04:08:27Z","title":"The Tug of War Within: Mitigating the Fairness-Privacy Conflicts in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16672","snapshot_observed_at":"2026-08-08T21:06:56.019041Z","title":"Dean: Deactivating the coupled neurons to mitigate fairness-privacy conflicts in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.019041Z"},"links":{"cited_paper":"/paper/2410.16672","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:57c76358dbd1634a0070b960ecf670103cb3a2c9d73834126ef4859c57071588","observation_id":"9df7f434-40a5-467f-824c-394f877165eb","resolution":{"observed_at":"2026-08-08T21:06:56.019041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.022839Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.022839Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:3297e8f97122eb0c762ee8de0cff13100b67b78b47e00ad39bd02ce8eeb7f74e","observation_id":"747cf1a8-5e93-4708-8a45-16bfebbf9b3c","resolution":{"observed_at":"2026-08-08T21:06:56.022839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14577","last_updated":"2024-10-30T22:58:40Z","snapshot_observed_at":"2026-07-06T18:18:39.093732Z","submitted_at":"2024-05-23T13:51:55Z","title":"Representation Noising: A Defence Mechanism Against Harmful Finetuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14577","snapshot_observed_at":"2026-08-08T21:06:56.026593Z","title":"Representation noising effectively prevents harmful fine-tuning on llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.026593Z"},"links":{"cited_paper":"/paper/2405.14577","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:7243b91811c15fc81c3bcd185b83e1a9ae90ab92d8c5b44fec44f85f49f5f20d","observation_id":"8c0bdbcb-74c2-45ee-80d8-7e72561f0d4f","resolution":{"observed_at":"2026-08-08T21:06:56.026593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01263","last_updated":"2024-04-01T11:50:35Z","snapshot_observed_at":"2026-08-03T00:58:55.865010Z","submitted_at":"2023-08-02T16:30:40Z","title":"XSTest: A Test Suite for Identifying Exaggerated Safety Behaviours in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01263","snapshot_observed_at":"2026-08-08T21:06:56.030792Z","title":"Xstest: A test suite for identifying exaggerated safety behaviours in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.030792Z"},"links":{"cited_paper":"/paper/2308.01263","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:f08f7fa2f8afc58252b787296ad1266c31e5bdaf88e5f2b0c70d440151766012","observation_id":"f1aa9788-3f59-43b1-9fcc-dc77ff0d4fc9","resolution":{"observed_at":"2026-08-08T21:06:56.030792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.034858Z","title":"The effective rank: A measure of effective dimensionality","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.034858Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:efa14e871c987d1b9972243ac60c2b9cb2c34eee0598aa95bee036afbd8be92f","observation_id":"c0568c9d-14e2-486f-b012-9c06393075b6","resolution":{"observed_at":"2026-08-08T21:06:56.034858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-08T21:06:56.038650Z","title":"Socialiqa: Com- monsense reasoning about social interactions","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.038650Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:2f579bc89aa538c9217149f62d8701b163ea5e3601c35c3c8102ea3e1f003ec0","observation_id":"60750dfb-be55-4241-815e-7f1a073573f9","resolution":{"observed_at":"2026-08-08T21:06:56.038650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.042629Z","title":"Facenet: A unified embedding for face recognition and clustering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.042629Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:2e58cb89b9c28a89b90d2c7d0ed390e30a0e078d25f76cd7eb93a1ca5e266bb8","observation_id":"b947ce92-bb8f-4fc5-bbe7-cbb7fd9dc66f","resolution":{"observed_at":"2026-08-08T21:06:56.042629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.125800Z","title":"Lmfingerprints: Visual explanations of language model embedding spaces through layerwise contextualization scores","venue":null,"work_id":"ce6fd575-92f8-42ef-a4cf-f7cdee8ec8de","year":2022},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.046235Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:e58eb34b91ae193c396c4259feef9bb8a67eaeeeb1f8f13515ff74d959063b63","observation_id":"17821f04-8ab1-4875-9197-6ea97b00a04f","resolution":{"observed_at":"2026-08-08T21:06:57.130582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.112276Z","title":"k-variance: A clustered notion of variance","venue":null,"work_id":"81f24d6b-372d-4b05-92cf-64667b872454","year":2022},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.050394Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:efa3da011dc55b2aecc6f23af1e7e4d9d96fcf62769534aac37d7de843adb581","observation_id":"e2c8f106-6e1b-4c54-961a-ecbcd71885f5","resolution":{"observed_at":"2026-08-08T21:06:57.116105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-08T21:06:56.054470Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.054470Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:521a19ea3e7bf07e68a887f2243c3e739c47ff0cb8ccda3ac6ed153e0ecff668","observation_id":"1de0eab6-ba41-4b39-ab5e-adb1a6deb80d","resolution":{"observed_at":"2026-08-08T21:06:56.054470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.059007Z","title":"Daniel Freeman, Theodore R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.059007Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:445f8e6eab4900e65f75d0dbdb908eb9cc0cfb6cfe7330b29f511f5cac230999","observation_id":"3e19d31c-1e90-4440-ad87-d31159744ba7","resolution":{"observed_at":"2026-08-08T21:06:56.059007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.063915Z","title":"Language models don’t always say what they think: unfaithful explanations in chain-of-thought prompting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.063915Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:56411c36599e46b8f6e963a9e1be6b770342973628da03c815cb759f74d27a96","observation_id":"93d11c2a-7849-4444-b3f6-cb06558089a2","resolution":{"observed_at":"2026-08-08T21:06:56.063915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.068139Z","title":"Optimal transport: old and new, volume 338","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.068139Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:36ba94db4a216718afe96487e6d0a3addbb89e6d2cf09ccce8820a9510932fcd","observation_id":"cd3ee770-4322-4bd8-9d30-f2c3e99d076c","resolution":{"observed_at":"2026-08-08T21:06:56.068139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.072383Z","title":"The wasserstein distances","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.072383Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:86135b6eab105597777a862b160db8f1500cdd12ec5acd88945c81c8ee2b9601","observation_id":"7e5f683d-ee24-4e37-bb56-4e66c8530de7","resolution":{"observed_at":"2026-08-08T21:06:56.072383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-07-06T06:34:26.609892Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-08T21:06:56.076683Z","title":"Glue: A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.076683Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:a3e3b7ed71e890e33901a520d007cd2f3351ac71fdd5a6bd61a2fc8df2c45a37","observation_id":"f8d9cf8e-f1cc-4754-95ea-77d0287e45b6","resolution":{"observed_at":"2026-08-08T21:06:56.076683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.081306Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.081306Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:8e6337f6596a6924af3a5935e54e53adec26967304ffbd91d26e19e64efd241b","observation_id":"c30e8831-9260-4a73-817d-aa3178454530","resolution":{"observed_at":"2026-08-08T21:06:56.081306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.053907Z","title":"Diff-erank: A novel rank-based metric for evaluating large language models","venue":null,"work_id":"695f7db4-c481-433a-a088-a082b7f20e98","year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.085269Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:3b8b71a9940f21f3cad113ad2a9a9f555f0d143a4101075606c38c8ebf34e845","observation_id":"d1bae7d8-6fc3-4d92-8aa1-a01fabec5b31","resolution":{"observed_at":"2026-08-08T21:06:57.057955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03592","last_updated":"2024-05-22T17:52:31Z","snapshot_observed_at":"2026-07-06T17:55:44.838732Z","submitted_at":"2024-04-04T17:00:37Z","title":"ReFT: Representation Finetuning for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03592","snapshot_observed_at":"2026-08-08T21:06:56.089277Z","title":"Reft: Representation finetuning for language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.089277Z"},"links":{"cited_paper":"/paper/2404.03592","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:fbd6c678106e4be14e3dfa46a2679ae4cd06145aef2ba21e90570e36eeaaf8c3","observation_id":"98241810-e6fc-4da6-b8c2-fdd71696400b","resolution":{"observed_at":"2026-08-08T21:06:56.089277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13712","last_updated":"2024-09-07T02:07:22Z","snapshot_observed_at":"2026-08-05T20:40:59.419241Z","submitted_at":"2024-09-07T02:07:22Z","title":"Good Idea or Not, Representation of LLM Could Tell","version":1},"cited_work":{"arxiv_id":"2409.13712","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.13712","snapshot_observed_at":"2026-08-08T21:06:56.366710Z","title":"Good Idea or Not, Representation of LLM Could Tell","venue":"cs.CL","work_id":"bbaac2a7-b71b-4cec-8417-834c7e07b59a","year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.093042Z"},"links":{"cited_paper":"/paper/2409.13712","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:144be9d393e7a38505299f71769d9e04892484bbbf3562d3fa1bd7d82e6c9fcc","observation_id":"7c478ef5-0b34-4c83-a5d5-0e163c9ce198","resolution":{"observed_at":"2026-08-08T21:06:56.371735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-08T21:06:56.096969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.096969Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:0274542f3e726771a1f9d01bc6d2d1f87996d2c163a64e4014bdfa8566bece73","observation_id":"f4abf341-265d-49b5-9dd6-72f6a8734d07","resolution":{"observed_at":"2026-08-08T21:06:56.096969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.100706Z","title":"A fingerprint for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.100706Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:00d907416aa5d9be427aeedd656ec1079b251de9348e6b60d2b2836f8c097d47","observation_id":"40f6b988-4f04-4cc0-a4eb-880f270b3154","resolution":{"observed_at":"2026-08-08T21:06:56.100706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01563","last_updated":"2024-10-31T02:04:53Z","snapshot_observed_at":"2026-08-02T15:06:52.727609Z","submitted_at":"2024-06-03T17:45:41Z","title":"LoFiT: Localized Fine-tuning on LLM Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01563","snapshot_observed_at":"2026-08-08T21:06:56.104290Z","title":"Lofit: Localized fine-tuning on llm representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.104290Z"},"links":{"cited_paper":"/paper/2406.01563","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:5230c6d8189f641c7fbb567ff8f51774cf43f6afbd6c3f57f514cabf14f02c72","observation_id":"091dd076-9a66-4127-95df-8f08f6cecf83","resolution":{"observed_at":"2026-08-08T21:06:56.104290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:56.108043Z","title":"Barlow twins: Self- supervised learning via redundancy reduction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.108043Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:794151e02d842df03d0c962a4d5f009c6e399ab99b817e17588ff65d615063da","observation_id":"dab498e3-2f81-4167-bdea-0c80fc1fe5dc","resolution":{"observed_at":"2026-08-08T21:06:56.108043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04281","last_updated":"2024-09-27T23:15:50Z","snapshot_observed_at":"2026-07-06T17:56:14.495769Z","submitted_at":"2024-04-03T03:17:28Z","title":"Similar Data Points Identification with LLM: A Human-in-the-loop Strategy Using Summarization and Hidden State Insights","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04281","snapshot_observed_at":"2026-08-08T21:06:56.111620Z","title":"Similar data points identification with llm: A human-in-the-loop strategy using summarization and hidden state insights","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.111620Z"},"links":{"cited_paper":"/paper/2404.04281","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:7e20d83b99c1e00ee3c33ea8fb7b26acc7c9a5342c4600f5a53f9d8551cc67d6","observation_id":"d647cc87-41ae-40f1-8821-278ab1fcf4b6","resolution":{"observed_at":"2026-08-08T21:06:56.111620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17169","last_updated":"2025-06-04T15:32:37Z","snapshot_observed_at":"2026-07-06T19:22:14.655041Z","submitted_at":"2024-09-17T22:40:54Z","title":"REAL: Response Embedding-based Alignment for LLMs","version":4},"cited_work":{"arxiv_id":"2409.17169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.17169","snapshot_observed_at":"2026-08-08T21:06:56.200979Z","title":"REAL: Response Embedding-based Alignment for LLMs","venue":"cs.CL","work_id":"88a305a8-8768-4f4c-b954-9da6ec71dcdf","year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.115603Z"},"links":{"cited_paper":"/paper/2409.17169","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:9ee286e429c0c2d3dd50320db5f8ce209cbbde75342fa8dd67f8a0a1c29b0ac3","observation_id":"dcbaeea0-a2a4-4a7a-b6d0-5364c23af323","resolution":{"observed_at":"2026-08-08T21:06:56.207427Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14273","last_updated":"2024-10-18T08:27:02Z","snapshot_observed_at":"2026-07-06T19:35:48.603411Z","submitted_at":"2024-10-18T08:27:02Z","title":"REEF: Representation Encoding Fingerprints for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14273","snapshot_observed_at":"2026-08-08T21:06:56.119689Z","title":"Reef: Representation encoding fingerprints for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.119689Z"},"links":{"cited_paper":"/paper/2410.14273","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:36240ee1424ddbe55ba45c8c3be6de7a1c09851b1f695e7bcd4e968459d3ae9f","observation_id":"62028e91-3ff0-4b67-8729-f27302ce3255","resolution":{"observed_at":"2026-08-08T21:06:56.119689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-08-07T12:51:50.861720Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06364","snapshot_observed_at":"2026-08-08T21:06:56.123451Z","title":"Agieval: A human-centric benchmark for evaluating foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.123451Z"},"links":{"cited_paper":"/paper/2304.06364","citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:73dfbbdafe23a87489f21120487a71fbd7eade0b6439800cba6758fc268009d2","observation_id":"a5d8497d-01d9-4a05-9ebb-a9209b335a59","resolution":{"observed_at":"2026-08-08T21:06:56.123451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.031880Z","title":"Improving alignment and robustness with circuit breakers","venue":null,"work_id":"860333d5-e406-4edb-aad9-d5f119da6583","year":2024},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.127637Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:64f48b026fb8b389ff86ea3cfa72aab0126e6494c1c8502dc64d14ef5ac21ed2","observation_id":"d4a13672-7dec-4bf3-a6fa-701fb7cf5a0d","resolution":{"observed_at":"2026-08-08T21:06:57.035985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.018983Z","title":"[ 62] disentangles LLMs’ awareness of fairness and privacy by deactivating the entangled neurons in representations","venue":null,"work_id":"13cdacb8-28bf-42f0-b479-34d603a597d3","year":null},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.131162Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:5c2d20be18036d6464c67a6ed94394c639a6f80cd95086ce3bf464aee0b0aa21","observation_id":"5e295cd8-8b93-4bf9-866d-ec29bbb9cc8e","resolution":{"observed_at":"2026-08-08T21:06:57.023153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:06:57.006060Z","title":"safe\" or","venue":null,"work_id":"5c39fa57-4044-49e2-85aa-4979ee2f0e69","year":null},"citing_paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T21:06:56.135403Z"},"links":{"citing_paper":"/paper/2502.05242"},"observation_digest":"sha256:a6604b697510dbc21ca7f5143b30a3d3645a2ae83af0ab826340256694a80765","observation_id":"f4ef902d-32e2-4788-bb28-1158b52b904a","resolution":{"observed_at":"2026-08-08T21:06:57.010023Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.05242","last_updated":"2026-05-27T09:11:42Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T20:58:31.381100Z","submitted_at":"2025-02-07T13:25:33Z","title":"Beyond External Monitors: Enhancing Transparency of Large Language Models for Easier Monitoring"},"reference_resolution":{"displayed":91,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":69,"verified_exact":7,"verified_fuzzy":14},"total_outbound_references":91},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 91 of 91 outbound references and 1 inbound Pith citation observation for arXiv:2502.05242."}