Pith. sign in

Paper Citation Record · LEDGER

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content

As of 18 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2504.16120.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2504.16120 v1

Coverage vector

measured 29 of 29 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-16T11:57:58.481821Z

measured 29 of 29 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

29 of 29 outbound references displayed

  • verified exact1
  • verified fuzzy8
  • unresolved20
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation a36507a3-bce5-4285-9dd6-c4f21cec32a5 · outbound

This paper cites HateBERT: Retraining BERT for Abusive Language Detection in English.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content HateBERT: Retraining BERT for Abusive Language Detection in English

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.349909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.349909Z digest=sha256:abcd196c1ca97e7cfec58ae2f631817a3fcbd01f13699e1a5848fe50e541b6f4

Observation 320e32b3-3abb-4d98-bc45-50e738c89da4 · outbound

This paper cites Generalizable implicit hate speech detection using contrastive learning.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Generalizable implicit hate speech detection using contrastive learning

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:59.009796Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T11:57:58.355237Z digest=sha256:8334b51112bf014ed04b68cad5c8303bb2090c9ac02485f5aa04cf5f3e7306ac

Observation 336e58c1-2cfe-4d1c-bf3d-e07727761498 · outbound

This paper cites Toxicity Detection with Generative Prompt-based Inference.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Toxicity Detection with Generative Prompt-based Inference

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.360079Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.360079Z digest=sha256:0a0d007be1da4d7fc1960c240c9b274701d5e283c57c4b3a06751c00d648e596

Observation 60bfc48d-daeb-4c23-ad37-d75bc4ece791 · outbound

This paper cites Interpretable Unified Language Checking.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Interpretable Unified Language Checking

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.365238Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.365238Z digest=sha256:36cc127e79e66a87c6c21eb316d3150fd6f7c71b7e1c0da148a0329bc44ae6cd

Observation 942e92d9-3e44-4cee-9252-678314e1b8dd · outbound

This paper cites Efficient toxic content detection by bootstrapping and distilling large language models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Efficient toxic content detection by bootstrapping and distilling large language models

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.994057Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T11:57:58.370279Z digest=sha256:2040b49e5379a466a6e66f33789d28d209dac2ea77521d7afd1ebecfbe94b8e2

Observation 0f16f588-b224-4399-9ac9-37a9e14e03e0 · outbound

This paper cites Autorag-hp: Automatic online hyper-parameter tuning for retrieval-augmented generation, 2024.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Autorag-hp: Automatic online hyper-parameter tuning for retrieval-augmented generation, 2024

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.978221Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T11:57:58.375333Z digest=sha256:68b54d99df04b3445f0232c57b17db50482436144d6eb4081f8806563e9893bd

Observation d7aff224-a7f6-4137-bc57-64d541e29bb4 · outbound

This paper cites Enhancing rag-retrieval to improve llms robustness and resilience to hallucinations.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Enhancing rag-retrieval to improve llms robustness and resilience to hallucinations

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.962628Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T11:57:58.380461Z digest=sha256:4f0703b1c4b19f3ee8a38830f53517039afe1e650f2f637b1c9b0dc756e09152

Observation 6e635869-fc1b-4e51-9553-e43277539d36 · outbound

This paper cites Beyond Task Performance: Evaluating and Reducing the Flaws of Large Multimodal Models with In-Context Learning.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Beyond Task Performance: Evaluating and Reducing the Flaws of Large Multimodal Models with In-Context Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.384880Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.384880Z digest=sha256:a24225b87c66f5c8486c30360537886f44d49c2ba59d4d5803b04c4399c90474

Observation 4a57a7fb-b546-4e15-8b5f-fdb0cdd21f80 · outbound

This paper cites Principle-driven self-alignment of language models from scratch with minimal human supervision.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Principle-driven self-alignment of language models from scratch with minimal human supervision

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.943906Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T11:57:58.389371Z digest=sha256:e3a108520e84781a8b2cb6b0adf31ecb10e4cd718a7e8ccf476ae5e847099561

Observation e9d6f8f8-ada5-48c8-a1c8-67027b085e5d · outbound

This paper cites Large Language Models Can Self-Improve.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Large Language Models Can Self-Improve

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.393817Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.393817Z digest=sha256:212ce9154d1fc3559dc7a510c1c52c7de01d04ed488765536ebb4d97c543f490

Observation 12df2720-929c-498a-81d4-be70bc9e27c2 · outbound

This paper cites Defending chatgpt against jailbreak attack via self-reminders.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Defending chatgpt against jailbreak attack via self-reminders

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.398683Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.398683Z digest=sha256:600f8b1c9a1bb43ffa2131e1bed3d10441f697cacc37314f944adc56ebc033f8

Observation 328eb7db-aa73-4019-a1bb-2600609ff86d · outbound

This paper cites Learning and Forgetting Unsafe Examples in Large Language Models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Learning and Forgetting Unsafe Examples in Large Language Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.403124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.403124Z digest=sha256:0abf50d714e6c00dff0dc9b224df3a944d0896d5838a47ea0e546b1447161476

Observation d057b93d-707c-4f3e-83be-681ddef8f05f · outbound

This paper cites CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.408251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.408251Z digest=sha256:c72d7457589eb36a4b3fd765cf31f5b57456f2298e61e4e04a1bd326b41a8232

Observation 4efc1b79-49e9-43bd-983c-8110d327362b · outbound

This paper cites N-Critics: Self-Refinement of Large Language Models with Ensemble of Critics.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content N-Critics: Self-Refinement of Large Language Models with Ensemble of Critics

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.413300Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.413300Z digest=sha256:f5bb63c657dddf324fb986225db379d4adf7d459d86ee8681101fa944a26181c

Observation d5dafa0f-1739-4a33-8471-f128150f9b1e · outbound

This paper cites Self-refine: Iterative refinement with self-feedback.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Self-refine: Iterative refinement with self-feedback

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.418083Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.418083Z digest=sha256:b1b73de07039133ab170719fda7a05ed85c282e4999493d35ce148266d0cf405

Observation c951aff8-9d27-4c74-b26c-0e1abec7eba9 · outbound

This paper cites Learning From Mistakes Makes LLM Better Reasoner.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Learning From Mistakes Makes LLM Better Reasoner

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.422905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.422905Z digest=sha256:ef572504ac3484f2096ce3af793b5ca3e762926fe75f333db42e9547020c4cbc

Observation 2e95c6c9-21bd-4feb-aa81-0e9731522847 · outbound

This paper cites On the Intersection of Self-Correction and Trust in Language Models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content On the Intersection of Self-Correction and Trust in Language Models

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-08-16T11:57:58.668317Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T11:57:58.427653Z digest=sha256:2969a287d382aee1ea42b3900e8efb6d3ad4a613a1f4ac93a999e34e60901ecd

Observation bdca6dd3-a4ea-485b-8a01-8c25ffec1435 · outbound

This paper cites Self-correcting LLM-controlled Diffusion Models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Self-correcting LLM-controlled Diffusion Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.432298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.432298Z digest=sha256:a8a3d67e205e526bcd0f960e02034d374730b53b2e71d42bec4eae0c3408c9a1

Observation 62211133-2455-4a2c-8fb3-50b068d890d2 · outbound

This paper cites Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.436976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.436976Z digest=sha256:00f9ccf60ece37fe76790b57a445eac7e2c855c65cb7df5ef725a6c3dc7b682d

Observation 9a84671f-7d73-4341-97fa-7a785fc02f8a · outbound

This paper cites SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content SELF-[IN]CORRECT: LLMs Struggle with Discriminating Self-Generated Responses

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.441508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.441508Z digest=sha256:a587932373157b9db7ef53f63a008fa05ce11c9661dedd740c061476c6604596

Observation 92cceca0-5f6a-4e54-9951-7ad63ac85a96 · outbound

This paper cites Large Language Models Cannot Self-Correct Reasoning Yet.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Large Language Models Cannot Self-Correct Reasoning Yet

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.445879Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.445879Z digest=sha256:8b758d7ff98bdaa4823f642f2ad0a16e253104fc37cbd5b094b859af87749b0f

Observation 50f6f01b-3dcc-4f2e-8df2-e8216a911a56 · outbound

This paper cites Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Confidence Matters: Revisiting Intrinsic Self-Correction Capabilities of Large Language Models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.450689Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.450689Z digest=sha256:9050c1d0412fb122c68b9cda30bcb8de3c2a3dd24cc7e78dc54a541fdd5a37ba

Observation c4a9de15-d9ee-471a-b5a3-04297d85cda3 · outbound

This paper cites Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in Self-Refined Open-Source Models.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Democratizing LLMs: An Exploration of Cost-Performance Trade-offs in Self-Refined Open-Source Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.455088Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.455088Z digest=sha256:31d1827449df79b7deeb144a0c1225f6cd8980df75bcd243ad7cdd51943055eb

Observation 0ebb4933-f62b-4d22-8a2f-3e5ab959c992 · outbound

This paper cites Model editing as a robust and denoised variant of dpo: A case study on toxicity.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Model editing as a robust and denoised variant of dpo: A case study on toxicity

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.898336Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T11:57:58.460027Z digest=sha256:9e11711b1724f05d837bcfbdfff81f7ffb08a55cf4d49ae94f68fa522351af7c

Observation 0024866d-96ea-4474-9adb-00402ab5ab4a · outbound

This paper cites Gpt-4 technical report, 2024.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Gpt-4 technical report, 2024

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.882566Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T11:57:58.464246Z digest=sha256:9dda771522a46d61cfc1f74e55c1bbff650360c581a26a46476aaecdf2152b3e

Observation 413fb6e2-2ebb-419e-a05c-91442c24af35 · outbound

This paper cites Dai, and Orhan Firat et al.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Dai, and Orhan Firat et al

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-16T11:57:58.865315Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T11:57:58.468665Z digest=sha256:d1dda24b7048e401c9f8f2d59fae1894745d355f86ae0a6e500669ed3999c1a1

Observation f7858d28-88a2-4eba-b66d-39c88436ce30 · outbound

This paper cites Mistral 7B.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Mistral 7B

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.473001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.473001Z digest=sha256:0a02b2b869f62af0056d3ab8c73a686d3ed7224bf27370e1644f485002acdcfd

Observation 3a28d03b-e9d8-44c7-bc94-f7f4a124058a · outbound

This paper cites Gemma: Open Models Based on Gemini Research and Technology.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Gemma: Open Models Based on Gemini Research and Technology

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-16T11:57:58.477590Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T11:57:58.477590Z digest=sha256:0b619a81c55fb7af1a378edf914929147ae074584935fb47dd0cb2f35687d6ec

Observation 688c89b4-8cd8-42db-bd51-d31a57780f21 · outbound

This paper cites an unresolved cited work.

A Data-Centric Approach for Safe and Secure Large Language Models against Threatening and Toxic Content Unresolved cited work

Reference 29

Resolution
unresolved
raw_fallback, observed 2026-08-16T11:57:58.848246Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-16T11:57:58.481821Z digest=sha256:ba72f770eb1acfcd479966de2b633f31b25fd67fdae39e64f770cc489c2d60d2

Pith citing papers

No inbound Pith citation observations are available.