{"as_of":"2026-08-12T22:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:45dae69b3c0ac4128935558d3eccb49d796ac77623b05c665657b30e12262ebf","coverage":[{"denominator":118,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:51:17.259117Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11171/citation-record","integrity":"/paper/2608.11171/integrity","json":"/paper/2608.11171/citation-record.json","paper":"/paper/2608.11171"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.630599Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.630599Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:99bd8a3a9112ce7297932164f5828592127f8807b7813a9bbe67cb05aa6c497a","observation_id":"8d9ca6f8-ec40-4cd2-9a0e-f359d768f7d3","resolution":{"observed_at":"2026-08-12T04:51:16.630599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.648681Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.648681Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:ee986ca7410c5b51a565b8274b064cf7ed891f65706075512117d184f3b841bd","observation_id":"de088d98-e2f9-4e2d-af73-5700f1053308","resolution":{"observed_at":"2026-08-12T04:51:16.648681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.667018Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.667018Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:d133a18adf9c26ea523f51d7d259b921a13609dba24f4dc2f979eb9d3dcd9bcf","observation_id":"bf5ef2da-7092-4ecf-aada-16d42922fd86","resolution":{"observed_at":"2026-08-12T04:51:16.667018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.671317Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.671317Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:c59d8447778dcf6d2c86dd15fb79f99732382d07480b17e61e24efc9a2d4e5e0","observation_id":"c011e2b4-367e-4497-9fa6-fa23c58f332f","resolution":{"observed_at":"2026-08-12T04:51:16.671317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.685034Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.685034Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:a3e23e78be5cfe45a36cb9cac569f8e0f88eb2873fd36f2c5042e44c8fb4e678","observation_id":"c8e8bca1-0a47-4526-81e7-a4ff31fb9f57","resolution":{"observed_at":"2026-08-12T04:51:16.685034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.690286Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.690286Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:8ed5228f0fc74abb2302683101cbaf953c1b951cf5ad52b9ea5c912b3218d551","observation_id":"baac49ac-a54a-4be1-b053-273459137e61","resolution":{"observed_at":"2026-08-12T04:51:16.690286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.737630Z","title":"don't forget the teachers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.737630Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:267f9f4c3011dfa26b84416dea16bcd215696b1eaeb5ff665c9995aebd4d906c","observation_id":"c4ffb726-c5f2-42d2-b97f-597a473e3724","resolution":{"observed_at":"2026-08-12T04:51:16.737630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.745842Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.745842Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:d0d7769fa8b40ddb1c78a771e7fb2385fe873e9cae75dd96a918375411d4334f","observation_id":"6b16f8c3-3af4-417c-bddc-72aef843c6b5","resolution":{"observed_at":"2026-08-12T04:51:16.745842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05561","last_updated":"2024-09-30T10:17:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-10T22:07:21Z","title":"TrustLLM: Trustworthiness in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05561","snapshot_observed_at":"2026-08-12T04:51:16.754194Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.754194Z"},"links":{"cited_paper":"/paper/2401.05561","citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:c4a678f9eccfdc863c115af598bbc6fe7ce9c5e7bc6b5dcbce6e7be1b8d290cd","observation_id":"9870e611-b528-4ab9-9e31-792d137b9324","resolution":{"observed_at":"2026-08-12T04:51:16.754194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.758736Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.758736Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:f3cefbed52e01ce3926c33529f36944f91a869c440698ea65d8831719fe98272","observation_id":"46401178-93bd-4429-a47e-4e174c89416b","resolution":{"observed_at":"2026-08-12T04:51:16.758736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.767502Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.767502Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:4d89f95c1e25d1120205428899df21304418305be6834db9e9f7799a00ffa363","observation_id":"831c3195-f441-40e5-a3e8-22ca521a3feb","resolution":{"observed_at":"2026-08-12T04:51:16.767502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.771478Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.771478Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:18cc989bc69407239c909f2a4bd160ad497232552ece76525f7da7f232bd518b","observation_id":"163ffdfc-8028-4fbd-a4a9-71c18d0b6783","resolution":{"observed_at":"2026-08-12T04:51:16.771478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.775652Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.775652Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:d994b978d3983113d59aaf7101d547b4752f3c075f04d8433b1c401cb1d14858","observation_id":"1a998e40-6912-4942-baef-7f9c23cbe17e","resolution":{"observed_at":"2026-08-12T04:51:16.775652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.811315Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.811315Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:0431f52a76b9299d0673709a5c49976409c6c8c04d90916b048f35f7503f46a8","observation_id":"645cca4e-9f50-4fb8-93ce-98e5cd658204","resolution":{"observed_at":"2026-08-12T04:51:16.811315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.815380Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.815380Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:c93eab5e3b542cd2b32fbd88d7511c23816917371d0279e0ad511fc241b3d6ba","observation_id":"f74c9f77-3b20-4494-981d-04f072dc2f58","resolution":{"observed_at":"2026-08-12T04:51:16.815380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.827962Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.827962Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:ce37875c714628f8ed0459e780695e744c456fd51a9ab50921d23d599c1ad2e9","observation_id":"b1e16acf-8f1e-42f5-a2a3-a5e70d8948fa","resolution":{"observed_at":"2026-08-12T04:51:16.827962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.857656Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.857656Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:dc6bad14badf6cead20680fba94414175ee4d9963dffb3c322edd85fae63128f","observation_id":"6041a784-e8cb-42c8-aa8a-ad32cb84e29a","resolution":{"observed_at":"2026-08-12T04:51:16.857656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.880222Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.880222Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:b44f38a4db73c004c60c12ff0dd84f1410232d91608816f1daff4712e25fb44f","observation_id":"7cddb846-25b5-4780-9965-db36f7c79c4b","resolution":{"observed_at":"2026-08-12T04:51:16.880222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11698","last_updated":"2024-02-26T20:41:01Z","snapshot_observed_at":"2026-08-07T02:34:39.980213Z","submitted_at":"2023-06-20T17:24:23Z","title":"DecodingTrust: A Comprehensive Assessment of Trustworthiness in GPT Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11698","snapshot_observed_at":"2026-08-12T04:51:16.888702Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.888702Z"},"links":{"cited_paper":"/paper/2306.11698","citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:93a60b7a1e635b62f097c853ba8e0c183c45bd3757bf0d4f9c6681625d7d23ad","observation_id":"68a32cee-7b52-4259-8f3a-8fe60d1019e6","resolution":{"observed_at":"2026-08-12T04:51:16.888702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.901804Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.901804Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:df9acb9cb8104d8d421cf49d9955ecd1f9b9c864a4a34e36c2a94083cfb1e08d","observation_id":"02bafdd9-53fb-4a9a-a152-1238249fb910","resolution":{"observed_at":"2026-08-12T04:51:16.901804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.919064Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.919064Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:4e88378c35edc062e3cdbe6944fd1ff47bd7f4e8418da8812cb6a75ed981db0c","observation_id":"3c7f868c-804e-474f-8090-2f9f3b95bf1c","resolution":{"observed_at":"2026-08-12T04:51:16.919064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.923408Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.923408Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:846d2730ce3c1dcf55f33e6fec5fc52b718d96b249fe731b15cc78cf9ff54290","observation_id":"0c8f1fc8-d6fe-4850-8274-79fed12bacdf","resolution":{"observed_at":"2026-08-12T04:51:16.923408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.927400Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.927400Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:96793a92488593d71fca07b53f60a1d58421b38c3d7901a049952c5637211e69","observation_id":"db943417-ff45-4671-91b0-ed7794a7416a","resolution":{"observed_at":"2026-08-12T04:51:16.927400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.931692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.931692Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:5c78bc6764042b7b79333ccf8050b388f123fb9051a3f6902edaf7ab127cfecb","observation_id":"c3b4fb2d-528f-4e0a-89e8-0382adcebc0b","resolution":{"observed_at":"2026-08-12T04:51:16.931692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.935849Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.935849Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:6934d7e2afefbd8b11c3da111f93484c7553b46004b897b3932459ff0e28dd8b","observation_id":"c479cfcd-9596-4125-8055-ad17f421356b","resolution":{"observed_at":"2026-08-12T04:51:16.935849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.939878Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.939878Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:c983ed462245e8a5322d1b8fef5dae6e8cc0a4d1f8dc8a2d223aea5a7d03818e","observation_id":"84c9f417-3d2e-4107-bed1-25062866139e","resolution":{"observed_at":"2026-08-12T04:51:16.939878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.944004Z","title":"Human-Centered Explainable AI : Towards a Reflective Sociotechnical Approach","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.944004Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:4b7b288c3a3f174694f4dd301e481b371476b4e062f919753d9dd7794ba13cca","observation_id":"26f9553c-e3d4-432a-a788-02e54cf8dc1e","resolution":{"observed_at":"2026-08-12T04:51:16.944004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.948539Z","title":"and Wintersberger, Philipp and Manger, Carina and Hubig, Nina and Savage, Saiph and Weisz, Justin D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.948539Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:0bec409ca1ee2f46fe4281b237a5f7851a14efeef3b02fa6137314bb77776990","observation_id":"107975d5-4d78-4da4-8757-05817c127b83","resolution":{"observed_at":"2026-08-12T04:51:16.948539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03712","last_updated":"2024-12-09T02:14:08Z","snapshot_observed_at":"2026-07-06T18:26:15.151211Z","submitted_at":"2024-06-06T03:15:13Z","title":"A Survey on Medical Large Language Models: Technology, Application, Trustworthiness, and Future Directions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03712","snapshot_observed_at":"2026-08-12T04:51:16.952670Z","title":"arXiv preprint arXiv:2406.03712 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.952670Z"},"links":{"cited_paper":"/paper/2406.03712","citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:033eda2e64ab369c8438e3cfd91edde68d8d2984554c949cc79f37eb35f676ce","observation_id":"0e2ea7ae-a4f9-46c1-9066-b8b0cf35c35a","resolution":{"observed_at":"2026-08-12T04:51:16.952670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15865","last_updated":"2025-06-02T10:13:24Z","snapshot_observed_at":"2026-08-12T13:27:29.622637Z","submitted_at":"2025-02-21T12:56:15Z","title":"Standard Benchmarks Fail -- Auditing LLM Agents in Finance Must Prioritize Risk","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15865","snapshot_observed_at":"2026-08-12T04:51:16.956798Z","title":"arXiv preprint arXiv:2502.15865 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.956798Z"},"links":{"cited_paper":"/paper/2502.15865","citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:185126d19ec6823d4ef40596c47eb54f635ff147f747b28daed96982d6a1b982","observation_id":"da851883-7758-46cc-820b-29c1860d8b97","resolution":{"observed_at":"2026-08-12T04:51:16.956798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.960742Z","title":"Don't Forget the Teachers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.960742Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:2fb37035549595ce9334bfc81544217e1319b323fdd0b28f62f5b7c0d41fe60f","observation_id":"91bc9c9d-60ba-4cbf-9cf8-667c86e04d82","resolution":{"observed_at":"2026-08-12T04:51:16.960742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.965221Z","title":"2025 Silicon Valley Cybersecurity Conference (SVCC) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.965221Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:ff962b3709fa29ee88c6b68b76146cf6636fa4cbb6cd3fef5b32aa2a612cabca","observation_id":"913fa84b-6be8-4080-8c9f-6d436179cc43","resolution":{"observed_at":"2026-08-12T04:51:16.965221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.969245Z","title":"2023 , url =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.969245Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:9560179d608dbfb9cabcfd7eae4a1c1a65a066537d08dcc34a9edc4d49802d8e","observation_id":"3bd9c0e2-d80d-419f-a421-d48a1d9b36af","resolution":{"observed_at":"2026-08-12T04:51:16.969245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.973582Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.973582Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:8b9f5ffe82ddcae9a9e61229f08ccb477f5792cfd8eb444bb0fde29728a7d9dc","observation_id":"4cf52372-36ab-4930-b5d2-9427461bb01c","resolution":{"observed_at":"2026-08-12T04:51:16.973582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05374","last_updated":"2024-03-21T00:21:14Z","snapshot_observed_at":"2026-08-02T17:09:20.540788Z","submitted_at":"2023-08-10T06:43:44Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05374","snapshot_observed_at":"2026-08-12T04:51:16.977677Z","title":"Trustworthy LLM s: A Survey and Guideline for Evaluating Large Language Models' Alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.977677Z"},"links":{"cited_paper":"/paper/2308.05374","citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:7c9ad1b10cc194ec9a50353cbbc98ef707b5c0a07a68a36adb789af4ca303e78","observation_id":"428c3343-a31c-4b1a-a90f-2fc70ef11344","resolution":{"observed_at":"2026-08-12T04:51:16.977677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.981843Z","title":"2025 , publisher=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.981843Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:2666712870697d0d64ed7ac076ecf755855d9d38e0046dac5611a0f8d78568ab","observation_id":"5efb6439-584c-4411-a97b-fb0b4b0a62ce","resolution":{"observed_at":"2026-08-12T04:51:16.981843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.986141Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.986141Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:6c57022314d88bf9d4929694459ec96523b52df8bbaec536f0e5c0e445439b7a","observation_id":"498ceeaf-2846-448f-bc20-7fc603cd67ae","resolution":{"observed_at":"2026-08-12T04:51:16.986141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.trustnlp-1.1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.575165Z","title":"Interpretability Rules: Jointly Bootstrapping a Neural Relation Extractor with an Explanation Decoder","venue":null,"work_id":"bcc043de-1aff-4a67-803b-ec0b573a43c8","year":2021},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.990589Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:7de9ba7fe32e1a613fdf4db3b3fe5dc4a1b8e8b4496d050837fb697768d26d67","observation_id":"37a8edc6-c58f-404c-b0a7-82c03f5dcfb3","resolution":{"observed_at":"2026-08-12T04:51:17.579945Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.trustnlp-1.2","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.891481Z","title":"Measuring Biases of Word Embeddings: What Similarity Measures and Descriptive Statistics to Use?","venue":null,"work_id":"0d38967d-d861-4926-b3e0-825e0c27b3b4","year":2021},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.994632Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:f17835e83e6c974da9fbd963d3d007d186b15dcc0fab4064af58ae7431b89707","observation_id":"fa99828f-2299-4b74-8df4-932c0a7707fd","resolution":{"observed_at":"2026-08-12T04:51:17.897013Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:16.999053Z","title":"and Kiritchenko, Svetlana and Balkir, Esma","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:16.999053Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:3007109416cd6e45526983288bb94de9be32a5015b11dc028a6cd266ce2f4229","observation_id":"0d500bcb-aa3f-47bf-870e-b15566842501","resolution":{"observed_at":"2026-08-12T04:51:16.999053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.003186Z","title":"GPT s Don ' t Keep Secrets: Searching for Backdoor Watermark Triggers in Autoregressive Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.003186Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:ae79a9c931676d003ff3e855eb7a7e481316a85372b9f9052a182e0676958415","observation_id":"977ce2f1-f298-4342-b774-2ceae3df2885","resolution":{"observed_at":"2026-08-12T04:51:17.003186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.007660Z","title":"Reliability Check: An Analysis of GPT -3's Response to Sensitive Topics and Prompt Wording","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.007660Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:41e6ef800bc276d5ff3fa112d810fe7e944795b92e6689ca8c47248463fc95b7","observation_id":"855102a8-6674-4972-b483-eab017c5bbfb","resolution":{"observed_at":"2026-08-12T04:51:17.007660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.011852Z","title":"Driving Context into Text-to-Text Privatization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.011852Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:75cc6c30aaaedbd813defeb2daa6f92a7baca3a042e5080820dae1d25b51423c","observation_id":"a2e7835e-f913-4a22-b938-6112a387e6b0","resolution":{"observed_at":"2026-08-12T04:51:17.011852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.016058Z","title":"Expanding Scope: Adapting E nglish Adversarial Attacks to C hinese","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.016058Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:93628afdbeb3e76421999255486df155cc596614b3a2455dc47136cf7d6923b0","observation_id":"a569e7ad-2d73-44ca-8d2e-99b7c9e94b1e","resolution":{"observed_at":"2026-08-12T04:51:17.016058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.020464Z","title":"Flatness-Aware Gradient Descent for Safe Conversational AI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.020464Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:b7be5e2347f25a857573b6a27afcd3b8c6ba854b736da6ac4d81075e00860aaf","observation_id":"0b3994e2-3d6e-410b-8a35-77b802cde3ba","resolution":{"observed_at":"2026-08-12T04:51:17.020464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.024785Z","title":"PBI -Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.024785Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:febf553538534233b85f30a4448f1a68877d7c47b1b71b70564d6e056b4fdfae","observation_id":"8a824ce0-ecf5-4508-b1c1-5e2749353908","resolution":{"observed_at":"2026-08-12T04:51:17.024785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.028942Z","title":"Beyond Text-to- SQL for IoT Defense: A Comprehensive Framework for Querying and Classifying IoT Threats","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.028942Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:9ab51e912ab663c5f38bdb202e943a0a042b29828006fe180219ce0e6331345e","observation_id":"70156afd-43f2-4b56-9937-21f1a44382fc","resolution":{"observed_at":"2026-08-12T04:51:17.028942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.033333Z","title":"Minimal Evidence Group Identification for Claim Verification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.033333Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:959f69584c575fbe0f855ea3091032ec941ee8a58d803adebb49eb1c1aef93c6","observation_id":"43c6f142-7da7-4d57-95c6-a3c650c01f21","resolution":{"observed_at":"2026-08-12T04:51:17.033333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.037344Z","title":"Estimating Knowledge in Large Language Models Without Generating a Single Token","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.037344Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:8d20a00e7d51a95a0ffae43c3c8551ba5a62c26c0e0978e24deeec3d2647d5a8","observation_id":"cd32d46d-f950-4093-ad1d-ba9016f142d7","resolution":{"observed_at":"2026-08-12T04:51:17.037344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.041415Z","title":"Intrinsic Test of Unlearning Using Parametric Knowledge Traces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.041415Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:9abb3ce136823ced7831dce2d2f6a0a00655672c4b9eb2d25d243759fd1d888c","observation_id":"e0f4c745-e219-4e72-80c3-ed429bbe5883","resolution":{"observed_at":"2026-08-12T04:51:17.041415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.045477Z","title":"Can we trust the evaluation on C hat GPT ?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.045477Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:b21128452e80f526d1acd7a6758de134a5d0504554c0fc13b3208541b97c5e3c","observation_id":"fde013c0-e009-4fed-9000-b955d5bd1970","resolution":{"observed_at":"2026-08-12T04:51:17.045477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.049608Z","title":"Improving Factuality of Abstractive Summarization via Contrastive Reward Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.049608Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:9ee0cbf5dce75da541864349268d160b02eb51f7880ff038daa236517afc8cad","observation_id":"bb79b921-8c81-4537-bcb9-a161c973fd60","resolution":{"observed_at":"2026-08-12T04:51:17.049608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.053733Z","title":"Exploring Causal Mechanisms for Machine Text Detection Methods","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.053733Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:bb17bd78d3a41f6873a270e58aca937345673ade5ea3e492debc0d30bce35ce7","observation_id":"81f29426-d024-4297-bba4-f31f8c9d42e3","resolution":{"observed_at":"2026-08-12T04:51:17.053733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.057835Z","title":"On the Robustness of Agentic Function Calling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.057835Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:f664c110882d1420f74139f3634e53437a0013f70e0d514c22dd85e74298b8da","observation_id":"29cfc788-99b7-49f6-9547-553936eebf07","resolution":{"observed_at":"2026-08-12T04:51:17.057835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.061990Z","title":"Cross-Task Defense: Instruction-Tuning LLM s for Content Safety","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.061990Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:e9e027717b5071087c781b9355104ff031cce48b3ddf760a29c1f6de079d81d3","observation_id":"e27a5b00-a18a-48c3-8fc1-db57c08867f8","resolution":{"observed_at":"2026-08-12T04:51:17.061990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.trustnlp-1.6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.710054Z","title":"Gender Bias in Natural Language Processing Across Human Languages","venue":null,"work_id":"e943bf91-85e3-4575-bd3f-359f9864d6a5","year":2021},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.066494Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:fb384b311cb2558a64b764c37c0c4ff3b1cd247c3ae82e5d3a2dea8a6197f5d3","observation_id":"d9e1eb20-7381-4116-8447-fdb5428c4c1e","resolution":{"observed_at":"2026-08-12T04:51:17.714511Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.071469Z","title":"Into the Gap between What Language Models Say and What They Know","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.071469Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:54562550a4cb415668ed92598857f45ff60490a9f3e336287e30631cd0af3923","observation_id":"c4df4eb7-a254-42fa-a742-7af291b2e8df","resolution":{"observed_at":"2026-08-12T04:51:17.071469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.075909Z","title":"The False Sense of Privacy in LLM s: Non-Verbatim Memorization and Semantic Leakage","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.075909Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:184e32920ef8cc6dbed52076ed3749314e72d43f98b9118ac3cfad63ad1186ce","observation_id":"1dd145f3-52cc-4863-b58e-f57ea78259a9","resolution":{"observed_at":"2026-08-12T04:51:17.075909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.081130Z","title":"and Raimundo, Marcos M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.081130Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:b903a77d1bd374bc6b900f91617bfe246de7fbc1a2a2c55a2c098765ea3f281a","observation_id":"665d41c0-4741-4d55-bfd6-a3f69d137367","resolution":{"observed_at":"2026-08-12T04:51:17.081130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.085233Z","title":"2023 , howpublished =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.085233Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:f209218495ebb79e5a70ca96916cf2dda181e6439e62f64415b9e3b46e4b384b","observation_id":"df6bb622-cc75-4d30-a7c2-7f3f0cf08de8","resolution":{"observed_at":"2026-08-12T04:51:17.085233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.089472Z","title":"Nature Machine Intelligence , volume=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.089472Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:1951425521e6017ecef48a5c4d4e9168c1214f895f7a51eb251d18db6fbcb45d","observation_id":"b8febde7-8661-42d9-a1ad-9d74840a86c0","resolution":{"observed_at":"2026-08-12T04:51:17.089472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:18.113262Z","title":"Formalizing Trust in Artificial Intelligence: Prerequisites, Causes and Goals of Human Trust in AI , year =","venue":null,"work_id":"826ac402-e118-4c2b-bb0d-83b614d3d2e1","year":2021},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.093468Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:c9e10ce3ace4e76a690a40ff2e654d003783a3cf5775b1c185673c12d203777a","observation_id":"86f3659e-2cca-43b0-90de-d40d432325ad","resolution":{"observed_at":"2026-08-12T04:51:18.118140Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.097633Z","title":"FAccT 2022 , year =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.097633Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:aed449693f5e89e357d41c3221f82ae20a11c410743b4dc0d8ee45a3d4043b2f","observation_id":"4ae1e4f8-d7f1-4291-852c-520c7d802d47","resolution":{"observed_at":"2026-08-12T04:51:17.097633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.eacl-main.116","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.448217Z","title":"SODAPOP : Open-Ended Discovery of Social Biases in Social Commonsense Reasoning Models","venue":null,"work_id":"1feebea4-a47b-4751-b073-b36265b3bcf1","year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.102185Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:9c2b96c30e77a827ded21afed7d44c35ae155c9cfcd7220b101586eaf376803a","observation_id":"0147a468-2552-4eda-a574-a7dee4c5c3ae","resolution":{"observed_at":"2026-08-12T04:51:17.453501Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.106463Z","title":"F air B elief - Assessing Harmful Beliefs in Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.106463Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:f847982f1dcd8c66a2958746a99bd46c945579c1bc5208580957eac0ab3fcfba","observation_id":"a4a719c5-83ac-4805-bb0e-d9e500235ea1","resolution":{"observed_at":"2026-08-12T04:51:17.106463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.110769Z","title":"Investigating and Addressing Hallucinations of LLM s in Tasks Involving Negation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.110769Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:9b925e2a90f40315647b1e3c0e4a6f8e876b2cb812a6e7de3b505c0f64a779eb","observation_id":"6f1b58e1-2ae7-4f1e-b79b-900131422633","resolution":{"observed_at":"2026-08-12T04:51:17.110769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.114972Z","title":"Introducing G en C eption for Multimodal LLM Benchmarking: You May Bypass Annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.114972Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:e6705b7e79d257c5f3bde043e0b2c3b856990d56810b63e3fd2e39e91d7dcff6","observation_id":"b6c78b3f-8159-465f-af7a-ee3361fa9b89","resolution":{"observed_at":"2026-08-12T04:51:17.114972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.119168Z","title":"Tell Me Why: Explainable Public Health Fact-Checking with Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.119168Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:f064442f05edce98fb097cba3ae24038e5df101db7a699cd28d917e02f8f80bc","observation_id":"1ae8427c-ff08-47d1-a8a4-5c26bd86b8ef","resolution":{"observed_at":"2026-08-12T04:51:17.119168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.123464Z","title":"Disentangling Linguistic Features with Dimension-Wise Analysis of Vector Embeddings","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.123464Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:04c32f481b4cd7614a85319b36f50e9c812df0b93a64a6830b17cfcfeb619447","observation_id":"006a2779-9e8f-4f0a-bcfe-076eb44a3cef","resolution":{"observed_at":"2026-08-12T04:51:17.123464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.127721Z","title":"On The Real-world Performance of Machine Translation: Exploring Social Media Post-authors' Perspectives","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":117,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.127721Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:ce84489bd54549200f980d25cba5ffb42cbac29f944e6f3a18293b4ff4703a9d","observation_id":"bb1c49fa-76ae-401e-b19e-adb654a3615f","resolution":{"observed_at":"2026-08-12T04:51:17.127721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.131935Z","title":"V i B e: A Text-to-Video Benchmark for Evaluating Hallucination in Large Multimodal Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.131935Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:0e3393eaf9036d8fb689597890cdb166b4c22a780cbbd1327e9025ed0623df20","observation_id":"3e020f1c-d738-4c26-8411-4ed746e324a8","resolution":{"observed_at":"2026-08-12T04:51:17.131935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.136528Z","title":"FACTOID : FAC tual en T ailment f O r halluc I nation Detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.136528Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:3abfc52f068394713d5b2c7a0e97d794d0b605d553fb06c1e8303e05234e3dc1","observation_id":"525ff90f-5571-4d9d-8c82-0760ff712954","resolution":{"observed_at":"2026-08-12T04:51:17.136528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.trustnlp-1.3","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.378228Z","title":"Private Release of Text Embedding Vectors","venue":null,"work_id":"c552e127-8fbd-437b-adff-8d5a52282755","year":2021},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":120,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.141076Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:780f725def094591abf32678509b3e5e53d759d90fb9d343bf790d61cd861bd1","observation_id":"90472fb8-a17a-4039-83a5-b2ab7fd06287","resolution":{"observed_at":"2026-08-12T04:51:17.384662Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.145503Z","title":"Challenges in Applying Explainability Methods to Improve the Fairness of NLP Models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.145503Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:d8526193d3362d1c08d3b6870f13ec210211014d3fe988e2f66a4a9af7a5484f","observation_id":"74282c53-747a-475f-98ee-858b036da7a9","resolution":{"observed_at":"2026-08-12T04:51:17.145503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.149773Z","title":"An Encoder Attribution Analysis for Dense Passage Retriever in Open-Domain Question Answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.149773Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:fa7978690f7bb34a61d864923155757c019f6d162af13281ca6716779b061c34","observation_id":"2bb8e51e-980a-4099-8f0a-675e9c86307c","resolution":{"observed_at":"2026-08-12T04:51:17.149773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.154226Z","title":"A Keyword Based Approach to Understanding the Overpenalization of Marginalized Groups by E nglish Marginal Abuse Models on T witter","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":123,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.154226Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:fe253061dee8689e7d4013429de8082a1ba6e614595f912b834adf55c520cb04","observation_id":"b90ff77c-5bbe-4c31-85ed-7a757a7e202a","resolution":{"observed_at":"2026-08-12T04:51:17.154226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:18.537152Z","title":"Examining the Causal Impact of First Names on Language Models: The Case of Social Commonsense Reasoning","venue":null,"work_id":"715488fb-91a0-4811-a2db-a53e0bcc5596","year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.158335Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:112c9186bff1f65d653d9f4a4a25ba30f7d4cdc1375a54370f20d6b7bee23a5a","observation_id":"adf32ab9-b7de-43be-b04c-19f465a8f73d","resolution":{"observed_at":"2026-08-12T04:51:18.541575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:18.523652Z","title":"An Empirical Study of Metrics to Measure Representational Harms in Pre-Trained Language Models","venue":null,"work_id":"025dda30-cec8-4ca9-99b7-3bebd9fd632a","year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.162510Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:e38cc855dd52ef99ed46dbb927b6d6fa3ac1743f9c804069155b7b6c23e31a47","observation_id":"9fa36f13-191e-494a-b98d-78ff65c182fa","resolution":{"observed_at":"2026-08-12T04:51:18.528229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:18.509924Z","title":"Beyond T uring: A Comparative Analysis of Approaches for Detecting Machine-Generated Text","venue":null,"work_id":"c512ca43-7fe2-41d4-9d80-aef2b338aa8e","year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.166956Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:a0c6b07511ddbf65a878edaa12f3abe98d3f93c5a36c2a101ddcd9157b58f0cf","observation_id":"341e203f-54ec-4c36-8eb9-9c88008c453a","resolution":{"observed_at":"2026-08-12T04:51:18.514337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:18.496178Z","title":"Automated Adversarial Discovery for Safety Classifiers","venue":null,"work_id":"9544340f-a1ce-4014-bf8b-5e5f8921e6ec","year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.171286Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:95f6c0a49b8a8db038e9572048ba1a14231c61c6caae6ceff29096ae040d00d0","observation_id":"005475b9-56ca-431d-848e-697fccbee092","resolution":{"observed_at":"2026-08-12T04:51:18.500532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:18.482427Z","title":"The Trade-off between Performance, Efficiency, and Fairness in Adapter Modules for Text Classification","venue":null,"work_id":"5a3afb37-1d8c-4a66-a182-054618c46ee5","year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":128,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.175925Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:7dae1c1c7df85d63c062b4867ddc3cd8eb216afc98f2dc17f462df6125af0b9e","observation_id":"7ea20418-09e4-482a-9562-f91ede53ab8f","resolution":{"observed_at":"2026-08-12T04:51:18.487078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:18.468295Z","title":"On the Interplay between Fairness and Explainability","venue":null,"work_id":"1e539a36-3aca-4676-96f4-8f278309025c","year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":129,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.180480Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:f1d206e0ffe82bb845696b0ff3d05f1648ef23d5330bc8abd35db71517969a38","observation_id":"190fa7b7-a3c4-4d80-876e-5395f7ffa0f7","resolution":{"observed_at":"2026-08-12T04:51:18.473132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:18.453304Z","title":"F act A lign: Fact-Level Hallucination Detection and Classification Through Knowledge Graph Alignment","venue":null,"work_id":"fc9db4fc-6c46-4f7c-87d4-977873edf957","year":2024},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":130,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.185252Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:4f65d53be1d464fd53241872432b2b55ab50a46a42758f433f86e71d68908242","observation_id":"55ba8d40-09b8-46fd-96da-4a6b551689e9","resolution":{"observed_at":"2026-08-12T04:51:18.458476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:18.438669Z","title":"Break the Breakout: Reinventing LM Defense Against Jailbreak Attacks with Self-Refine","venue":null,"work_id":"90b7d2d4-f836-4a2e-bace-e64bdab0992e","year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":131,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.190099Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:31bb05314ca82d2b16a7d42d596d3ceaff01bbad5e0f77ae611b38b241ad3a47","observation_id":"8c75aa3a-5794-4c63-88b4-404d2bc63ee8","resolution":{"observed_at":"2026-08-12T04:51:18.443147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:18.423902Z","title":"Ambiguity Detection and Uncertainty Calibration for Question Answering with Large Language Models","venue":null,"work_id":"4adfbc2f-c98b-49e8-bcdb-b210c48d8cab","year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":132,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.194565Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:13c465da78bb3ff4ab688825eeecc265c03731e24dee9eda3575f380664c9307","observation_id":"6f66e172-2292-46bb-b6a1-953db8cc11f4","resolution":{"observed_at":"2026-08-12T04:51:18.428494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.198931Z","title":"Error Detection for Multimodal Classification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.198931Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:423e53d3a76e4c5e157a6a70bb0a44c45177aab665f9185778f9528ecce2a635","observation_id":"29146040-7016-4cff-8c6c-ea063beffc48","resolution":{"observed_at":"2026-08-12T04:51:17.198931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:18.410152Z","title":"Know What You do Not Know: Verbalized Uncertainty Estimation Robustness on Corrupted Images in Vision-Language Models","venue":null,"work_id":"7dec2fe1-bcee-4c87-aaae-3f0df2d498f1","year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":134,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.203373Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:5d13245d0c765ada0d504f4d302fdf12aacc848a8693c18232fcb59eb4970d06","observation_id":"91c8a12d-937d-4e08-ba69-3eec055fa2a8","resolution":{"observed_at":"2026-08-12T04:51:18.414831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:18.395492Z","title":"Multi-lingual Multi-turn Automated Red Teaming for LLM s","venue":null,"work_id":"f7e1651f-5f29-4b32-9c61-1ae81c1ded28","year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.207859Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:38b83e2d5699e8526369643160bbf830e0e105c5dbef2b6d2c7c5e4e93b0eb95","observation_id":"a7212c6c-36cd-4ffb-b00b-7e7f9fc293b7","resolution":{"observed_at":"2026-08-12T04:51:18.400454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:18.381243Z","title":"Line of Duty: Evaluating LLM Self-Knowledge via Consistency in Feasibility Boundaries","venue":null,"work_id":"f521a5c5-6fcd-4f07-8dbc-287a86413caf","year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":136,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.212116Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:2304759cdedef9c0be5c772e512e3ba1b0f6e50717b13476b1902ee7aa038975","observation_id":"5be57346-eaa7-4f20-8844-ef8f0db1a5bf","resolution":{"observed_at":"2026-08-12T04:51:18.385972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11133","last_updated":"2025-09-03T17:03:15Z","snapshot_observed_at":"2026-08-12T10:11:48.779567Z","submitted_at":"2025-08-15T00:58:10Z","title":"MoNaCo: More Natural and Complex Questions for Reasoning Across Dozens of Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11133","snapshot_observed_at":"2026-08-12T04:51:17.216216Z","title":"M o N a C o: More Natural and Complex Questions for Reasoning Across Dozens of Documents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":137,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.216216Z"},"links":{"cited_paper":"/paper/2508.11133","citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:21322e9cdcb881e97d28f994245afdfe74b6bc084d5ce0b973554bb265194b7e","observation_id":"4fb8417f-d540-425e-9264-e7743f4588b2","resolution":{"observed_at":"2026-08-12T04:51:17.216216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.220598Z","title":"and Aletras, Nikolaos and Ma, Ning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.220598Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:f4afc1a4c6671e3ffa4a2d4feafbff3a84334f58acb9a983d6b3b9d3e7197a65","observation_id":"54f6a97a-3cd1-4e93-afd0-4e4e809588cf","resolution":{"observed_at":"2026-08-12T04:51:17.220598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.14168","last_updated":"2021-12-28T14:54:18Z","snapshot_observed_at":"2026-08-10T00:55:42.871418Z","submitted_at":"2021-12-28T14:54:18Z","title":"A Survey on Gender Bias in Natural Language Processing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.14168","snapshot_observed_at":"2026-08-12T04:51:17.224833Z","title":"A Survey on Gender Bias in Natural Language Processing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":139,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.224833Z"},"links":{"cited_paper":"/paper/2112.14168","citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:4a1829bb7182010189b3f0f3537b1e5143a0f07a64b9296660d6e3ea5f89bd89","observation_id":"7046bf1a-afc2-43c3-b9cf-0cafdae14f5b","resolution":{"observed_at":"2026-08-12T04:51:17.224833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.229554Z","title":"Inducing Positive Perspectives with Text Reframing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.229554Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:d5184efe68fb403402614bacbde4796abc1615103903064e78755372deb62da4","observation_id":"443dba07-8f5f-40a6-8d92-ae7ad2edc7fa","resolution":{"observed_at":"2026-08-12T04:51:17.229554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.233451Z","title":"The Importance of Modeling Social Factors of Language: Theory and Practice","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.233451Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:1a1c9e55463cbecfc2626e1e2af3ecf069cc41ec636aeb2d66034e8d5e287ad5","observation_id":"a71ace5c-74d1-4d18-9a9d-2fe24ea8f402","resolution":{"observed_at":"2026-08-12T04:51:17.233451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T04:51:17.237236Z","title":"arXiv preprint arXiv:2307.09288 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.237236Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:d826b745531cb32cbc4702128fe0e3b1f576213f41dfae20ce6c214a1bec1771","observation_id":"1e9ce44b-5ca1-4dc6-b711-3998d2ef9c6d","resolution":{"observed_at":"2026-08-12T04:51:17.237236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.241762Z","title":"2023 , howpublished =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":143,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.241762Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:e5f33e6aad670e8703833ae580a7354600398798b689f0b4dab14e55532074d8","observation_id":"258c868f-edfa-44fd-8a50-a06277381181","resolution":{"observed_at":"2026-08-12T04:51:17.241762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T04:51:17.246222Z","title":"arXiv preprint arXiv:2303.08774 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":144,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.246222Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:87676f5f5c905b950926f7460f4982c76b519a85a93a74dc121dd40af05c6ac2","observation_id":"7650e705-1670-4fde-aa0c-ef1a3c49304a","resolution":{"observed_at":"2026-08-12T04:51:17.246222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.250929Z","title":"Strength in Numbers: Estimating Confidence of Large Language Models by Prompt Agreement","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":145,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.250929Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:6a1e3862efd0a9e92953ddb5e197dfcf392692926efdb747496441b88310d1a0","observation_id":"4a4c4ba2-69bc-47c8-92bb-119dbf2d7bf4","resolution":{"observed_at":"2026-08-12T04:51:17.250929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.255122Z","title":"On the Intrinsic and Extrinsic Fairness Evaluation Metrics for Contextualized Language Representations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.255122Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:d7df8077eea24d0e5cc83f2e6701b3fef8d081ec545e872b209452f5b23c1ff4","observation_id":"4617b8f3-ce41-4840-a759-dd30de6748b9","resolution":{"observed_at":"2026-08-12T04:51:17.255122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:51:17.259117Z","title":"Pay Attention to the Robustness of C hinese Minority Language Models! Syllable-level Textual Adversarial Attack on T ibetan Script","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-08-12T04:51:17.259117Z"},"links":{"citing_paper":"/paper/2608.11171"},"observation_digest":"sha256:381bb0149df087392f8e8901a0882146a9dc4991008816dcda79ab47c18dc3e4","observation_id":"9b6dd65d-2dd3-4dc9-b107-a6e7c1e3b72c","resolution":{"observed_at":"2026-08-12T04:51:17.259117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.11171","last_updated":"2026-08-11T17:30:16Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T22:27:24.417877Z","submitted_at":"2026-08-11T17:30:16Z","title":"From Interpretability to Control: Insights from Six Years of the TrustNLP Workshop"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":82,"verified_exact":6,"verified_fuzzy":12},"total_outbound_references":118},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 100 of 118 outbound references and 0 inbound Pith citation observations for arXiv:2608.11171."}