{"as_of":"2026-08-18T08:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97ef9d62d39ef8fc675d6557631043e5a92f59e15bb5e83a3fceaa08fc009425","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:21:09.834127Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.18572/citation-record","integrity":"/paper/2504.18572/integrity","json":"/paper/2504.18572/citation-record.json","paper":"/paper/2504.18572"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.365267Z","title":"Natural language processing: State of the art, current trends and challenges","venue":null,"work_id":"e797a441-3c5b-4b18-8daf-e7335729e8af","year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.675459Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:db6249c9b78c9e6e3f066193a4b549cd310c7351c093a59398a7c75a1183b09c","observation_id":"98efdbdd-028e-4080-90a2-8aa8efd840de","resolution":{"observed_at":"2026-08-16T11:21:10.370761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:09.680861Z","title":"Multilingual machine translation with large language models: Empirical results and analysis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.680861Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:443abd6e931c1d0eb02340f4518eec7993cd5fd5c96d7934df69a2f2b4473f46","observation_id":"e0e9772e-993e-4570-8202-8fb6fb26c4fe","resolution":{"observed_at":"2026-08-16T11:21:09.680861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.338798Z","title":"Wordcraft: story writing with large language models","venue":null,"work_id":"d19b1524-c2c3-4a33-b036-e4489de5214c","year":2022},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.685409Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:e446bbd1aad984aa073b9c5220daea4e9a46f4b1b4fbb47479a8df18eaeb14fb","observation_id":"90a70ab8-e798-4eca-8c9c-189eaee12bc1","resolution":{"observed_at":"2026-08-16T11:21:10.343666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.323252Z","title":"https://medium.com/whatnot - engineering/enhancing-search-using-large-language-models-f9dcb988bdb9","venue":null,"work_id":"fe2e6ca1-a09e-427b-9159-5aa0046b7a58","year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.690348Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:4752e4d713cb6dbd9287f7edd06e46227a24fa7fff066f70a98c3af4cc13112a","observation_id":"a5a355d9-353a-46cb-8f84-ef2e8518e0b0","resolution":{"observed_at":"2026-08-16T11:21:10.328475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-18T03:59:39.242039Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-16T11:21:09.694984Z","title":"Code llama: Open foundation models for code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.694984Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:2763bb7f168da815e5dc536679b4d82c8883a2277502837f37f0428cb0e7372b","observation_id":"98c32250-c170-4b33-96a1-35ef5b150813","resolution":{"observed_at":"2026-08-16T11:21:09.694984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:09.699694Z","title":"Bloomberggpt: A large language model for finance, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.699694Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:6089b6118f829a7d84844610f529e292275a06cf37e39482b3d22b304a37383a","observation_id":"36ee1f7b-e6a1-41ab-bba3-43f89a885d4d","resolution":{"observed_at":"2026-08-16T11:21:09.699694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:09.704697Z","title":"The impact of large language models on scientific discovery: a preliminary study using gpt-4, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.704697Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:0a900eb832012a02937c0b9255df35f15c7cba79cf98b1cb40349ac299c1e71d","observation_id":"0703a95a-74aa-4f88-b36c-c5598e2258bf","resolution":{"observed_at":"2026-08-16T11:21:09.704697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.287910Z","title":"Pllama: An open -source large language model for plant science, 2024","venue":null,"work_id":"b075c968-f6ee-4f25-9420-1026abda63d9","year":2024},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.709185Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:cc39f00f2d0f611dbe27b47cb95e124b6779b5a2cd200e47692f06c8985af3a4","observation_id":"226de855-8c00-4e3b-bf8b-1c17a7b76954","resolution":{"observed_at":"2026-08-16T11:21:10.292496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.273504Z","title":"Artgpt-4: Artistic vision-language understanding with adapter-enhanced minigpt-4, 2023","venue":null,"work_id":"43c04a75-1758-472c-9758-f24a4bf0f6f7","year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.713659Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:d2b38986592015b99a89ff1bf659075f73433c0d46a3b2c6b769c8326fd9a967","observation_id":"fc13c7a3-9bbd-49ca-972c-4255cda2c17d","resolution":{"observed_at":"2026-08-16T11:21:10.277936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.258796Z","title":"Taoli llama","venue":null,"work_id":"f86100b2-f575-4238-a610-26e52bd5aac5","year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.717508Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:1ec53fe9f78fc99d2f05c01cd49a379bb44f1fe58a4c8e822af3d46e0472e603","observation_id":"157f1900-e870-4cf3-bce3-25772c0224bf","resolution":{"observed_at":"2026-08-16T11:21:10.263420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.245019Z","title":"Marinegpt: Unlocking secrets of “ocean” to the public, 2023","venue":null,"work_id":"202bce6d-2dff-4b94-8fc2-9b4ee66039ce","year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.721396Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:590f1a488ed0b80fe0155f3abb22a792334364ef0144cc8512e747778342ae8a","observation_id":"769cd097-00a7-4cb4-9f01-9acaa6065ac0","resolution":{"observed_at":"2026-08-16T11:21:10.249117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.231345Z","title":"Disc-lawllm: Fine-tuning large language models for intelligent legal services, 2023","venue":null,"work_id":"11a08539-bb36-4441-b3bf-f7cbca1d518a","year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.725366Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:585167838358a69940d10a2c1b190f548e52b2e9f42328a25c1460a221349ec6","observation_id":"51c88f23-8d03-44d4-88b4-fa72ec605517","resolution":{"observed_at":"2026-08-16T11:21:10.235715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:09.729203Z","title":"Large language models and political science","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.729203Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:66d682d96510b14c98dbab6f1db93feed84089f2f500028d3ff1f4b832e0ca77","observation_id":"ebb52783-b724-402d-82d1-b57fc0eb3ad0","resolution":{"observed_at":"2026-08-16T11:21:09.729203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:09.733025Z","title":"Alpacare:instruction-tuned large language models for medical application, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.733025Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:f92cdff9516e5c22d70b6088161bf7435fe648e35f25f08b282dbe30d34daa77","observation_id":"4a57423f-20f1-46af-a1e8-9f67963cf49a","resolution":{"observed_at":"2026-08-16T11:21:09.733025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.197815Z","title":"Davison, Quanzheng Li, Yong Chen, Hongfang Liu, and Lichao Sun","venue":null,"work_id":"aeec39f9-d63e-421c-8dbe-07cebeea9300","year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.736905Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:ae5584a3111defa62b6ca351c8ff88c2c8ea909d06826d87ebad9c6b7eb66512","observation_id":"fc4c6b75-4d0d-4462-ac74-944233082852","resolution":{"observed_at":"2026-08-16T11:21:10.202818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.182792Z","title":"Factuality challenges in the era of large language models, 2023","venue":null,"work_id":"14c3e595-8fc3-4c87-a01e-bc0d449afbeb","year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.740828Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:28631181bdeaf28327e131802dfe44545cf871ae3c007b9959d066bd25a1d45f","observation_id":"4a889158-793c-47c8-b413-7485049af38a","resolution":{"observed_at":"2026-08-16T11:21:10.187586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:09.744747Z","title":"Unraveling the link between translations and gender bias in llms, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.744747Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:1d4733462a7915a14bc0c8b49720f41c71f8be59aa1e638a9d3b1d42685b6665","observation_id":"91025a1d-f9c2-4db6-9fc9-e5e0f3305169","resolution":{"observed_at":"2026-08-16T11:21:09.744747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-08-15T10:16:52.688429Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-08-16T11:21:09.748380Z","title":"Jailbroken: How does llm safety training fail? arXiv preprint arXiv:2307.02483, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.748380Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:d35da53c28c77c4ebaf77a49b8cf4276ff38650fde3abe7f6287745e84573bbe","observation_id":"409c95cb-a209-4132-87c8-0a51d80203b8","resolution":{"observed_at":"2026-08-16T11:21:09.748380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.157534Z","title":null,"venue":null,"work_id":"14fe6f23-27af-47b2-b131-5318824efb68","year":2024},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.753018Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:aa07858476f2e1e97808120e60be888b4aca13c2e66491d94a2ce78b01897ff3","observation_id":"e367df9f-18f4-490b-9bdd-909e86452bb0","resolution":{"observed_at":"2026-08-16T11:21:10.162817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T11:21:09.757065Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.757065Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:396235eb2cfa8aa09b976adad1319ae5d0f91140f8171cc26b93e3b2bbcb1a11","observation_id":"1c91cfb2-46f9-4b80-aaa6-d13192a878c7","resolution":{"observed_at":"2026-08-16T11:21:09.757065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.141710Z","title":"Maieutic Prompting: Logically Consistent Reasoning with Recursive Explanations","venue":null,"work_id":"d107c5cc-7a51-4298-a85d-b83beb995d30","year":2022},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.761678Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:a059a63495915975086cc1f14ddf604d5b03780ce9a0052bd081ea4325a633f8","observation_id":"6f865b43-d8de-4d45-b35a-3738878826ed","resolution":{"observed_at":"2026-08-16T11:21:10.146454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.126928Z","title":"Large Language Models are Zero-Shot Reasoners","venue":null,"work_id":"e6521140-a3df-4eed-8ed3-2b734b056939","year":2022},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.766015Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:824261298c524d0e154f795f82c61fc99d15cb03ebf03efa050cc8ab84335503","observation_id":"1580d568-7c04-4c3c-a295-00c439476217","resolution":{"observed_at":"2026-08-16T11:21:10.131506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04735","last_updated":"2024-03-05T17:29:06Z","snapshot_observed_at":"2026-08-17T16:08:41.860799Z","submitted_at":"2023-06-07T19:11:25Z","title":"Soft-prompt Tuning for Large Language Models to Evaluate Bias","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04735","snapshot_observed_at":"2026-08-16T11:21:09.770240Z","title":"Soft-prompt Tuning for Large Language Models to Evaluate Bias","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.770240Z"},"links":{"cited_paper":"/paper/2306.04735","citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:1318d36ae1a9bdea4229c4704bec4dfb31c4fa519c44b060088f9949436ad7c5","observation_id":"59ae4b4f-5cb9-49b5-9711-7ebd9097a4f4","resolution":{"observed_at":"2026-08-16T11:21:09.770240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.111827Z","title":"Chi, Quoc V","venue":null,"work_id":"aa378048-e55b-4739-b529-388b82a56a7e","year":2022},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.774719Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:25dd33681c013ea234e5d715f0b44eeca142078dd33618efccfc946abe435944","observation_id":"f70a547d-3c60-4929-9829-d92d18e01aad","resolution":{"observed_at":"2026-08-16T11:21:10.116345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-16T11:21:09.779030Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.779030Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:ad410b874982556eede6bc59ab54946e0554ad89dcb349ae6749c1144aa6e52e","observation_id":"d8f37bf0-8bda-488b-a542-de327ac31989","resolution":{"observed_at":"2026-08-16T11:21:09.779030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09687","last_updated":"2024-02-06T18:00:18Z","snapshot_observed_at":"2026-08-16T15:07:28.783544Z","submitted_at":"2023-08-18T17:29:23Z","title":"Graph of Thoughts: Solving Elaborate Problems with Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09687","snapshot_observed_at":"2026-08-16T11:21:09.783829Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.783829Z"},"links":{"cited_paper":"/paper/2308.09687","citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:418aafdad5519dcc3b3b58a84462030390e4b04bbaa56eb751633e9e0aae5229","observation_id":"8f329d8a-3870-4189-8e0a-5fd9d567fb28","resolution":{"observed_at":"2026-08-16T11:21:09.783829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16582","last_updated":"2024-03-23T03:06:54Z","snapshot_observed_at":"2026-08-16T15:29:29.781885Z","submitted_at":"2023-05-26T02:15:09Z","title":"Beyond Chain-of-Thought, Effective Graph-of-Thought Reasoning in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16582","snapshot_observed_at":"2026-08-16T11:21:09.788504Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.788504Z"},"links":{"cited_paper":"/paper/2305.16582","citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:0db75f83c2c330def8120e30404a2b5745e01cfcd78b9178a9b94f70e21f70cb","observation_id":"05dd6804-b44b-4a78-a7bf-291dd05c07a5","resolution":{"observed_at":"2026-08-16T11:21:09.788504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.096927Z","title":"Le, and Ed H","venue":null,"work_id":"f556859a-82d3-418e-8c6d-50bffd99b434","year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.793449Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:0e9a33a3ab47db705fff2d6e006845f0f20e158a05a6e7d822837238dc6d6559","observation_id":"00ae8f80-cef1-4fe5-9ab7-00638f63aca0","resolution":{"observed_at":"2026-08-16T11:21:10.101525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.081192Z","title":"Self -consistency improves chain of thought reasoning in Infosys Responsible AI Office language models","venue":null,"work_id":"89c61ad4-12a7-4ba3-ba65-9adb6aa3aede","year":2022},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.797860Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:d9b5e55b1cf991edd721eda2a595cd4b4d34ebf4e3d3f161d15211237c3bad51","observation_id":"027cb75c-6c49-4b96-8792-f2d4886c5164","resolution":{"observed_at":"2026-08-16T11:21:10.086006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:09.802228Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.802228Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:839000946013b5ae1aed422c5837cc9623c152e3573bfaaa127b3a7c90ecc62e","observation_id":"29e7abaa-4027-4808-bdcc-512f4c2c9064","resolution":{"observed_at":"2026-08-16T11:21:09.802228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-16T11:21:09.806502Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.806502Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:35ddb327c5bef0c6bbd071401937fcaebed5c11d4559aa483bbf29ef1455fa51","observation_id":"ae236c1a-ef04-456c-8d9c-a5246a769a16","resolution":{"observed_at":"2026-08-16T11:21:09.806502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08734","last_updated":"2023-11-15T06:54:44Z","snapshot_observed_at":"2026-08-16T14:43:11.499242Z","submitted_at":"2023-11-15T06:54:44Z","title":"Thread of Thought Unraveling Chaotic Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08734","snapshot_observed_at":"2026-08-16T11:21:09.811047Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.811047Z"},"links":{"cited_paper":"/paper/2311.08734","citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:e34338581e65d1b93bd464bccb65184fb0abe95bea3751164440fd43d02f0374","observation_id":"634891e2-62f2-4fc5-b9c3-0a1ab0457a66","resolution":{"observed_at":"2026-08-16T11:21:09.811047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:09.815808Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.815808Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:a0fae3c6d74e8ebc9e7748e26cb9a935fb13609524ef7bac2e27922dae58ebeb","observation_id":"9a816261-d817-489b-b40f-4152c574f2fd","resolution":{"observed_at":"2026-08-16T11:21:09.815808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17539","last_updated":"2025-02-07T01:16:53Z","snapshot_observed_at":"2026-08-16T13:15:16.145032Z","submitted_at":"2024-09-26T04:59:45Z","title":"Logic-of-Thought: Injecting Logic into Contexts for Full Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17539","snapshot_observed_at":"2026-08-16T11:21:09.820238Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.820238Z"},"links":{"cited_paper":"/paper/2409.17539","citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:6550653a52d421d774bd6e9d4e27d5f0a81ad904a7bce0cc35c15a56bedc0d41","observation_id":"e8dd44d4-d7fa-4777-a87a-b59641704a50","resolution":{"observed_at":"2026-08-16T11:21:09.820238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.056503Z","title":null,"venue":null,"work_id":"c9e0a7c8-0f4d-4a2e-b354-69b0be470dfa","year":2023},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.825142Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:da1e9ff6ed7c15f5f9bd28785344a31ae10742440c9c35a60ddfc0c4b40b471d","observation_id":"4a54889c-6f82-4d57-862f-9d0e39eb0df4","resolution":{"observed_at":"2026-08-16T11:21:10.061014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:09.829655Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.829655Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:f5a76dfeb1f60a21bfbc2bbfeb400b8a26f31fb7fb8039516a35335034b0beb6","observation_id":"ad1ca8c4-2239-4269-84eb-d24dde5154a3","resolution":{"observed_at":"2026-08-16T11:21:09.829655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:21:10.038929Z","title":"Orca: Progressive Learning from Complex Explanation Traces of GPT-4","venue":null,"work_id":"d559d148-4d6e-4bce-add1-da4e1cfa4d85","year":null},"citing_paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:21:09.834127Z"},"links":{"citing_paper":"/paper/2504.18572"},"observation_digest":"sha256:3c95a7a1b007316ee35b7769847d681901d4a06fc808345d69a04371c3f83517","observation_id":"aed2573d-b198-4991-a8f1-c06cf1518245","resolution":{"observed_at":"2026-08-16T11:21:10.045705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.18572","last_updated":"2025-04-22T11:15:23Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T15:44:27.644906Z","submitted_at":"2025-04-22T11:15:23Z","title":"BELL: Benchmarking the Explainability of Large Language Models"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2504.18572."}