Pith. sign in

Paper Citation Record · LEDGER

Okapi: Instruction-tuned Large Language Models in Multiple Languages with Reinforcement Learning from Human Feedback

As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2307.16039.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2307.16039 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 5 of 5 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T23:23:32.490637Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-23T04:55:24.835950Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 9adc86c2-8131-4a2c-ace1-61ac0989f332 · inbound

RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback cites this paper.

RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback Okapi: Instruction-tuned Large Language Models in Multiple Languages with Reinforcement Learning from Human Feedback

Reference 80

Resolution
verified exact
arxiv_id, observed 2026-05-15T21:32:27.921382Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-05-15T21:32:27.806494Z digest=sha256:a975d6650a1f1308ef9c97b4a5a8ff612489b3773ae29cedff22b4b1bb88e0c1

Observation dd7540e7-cb29-4bee-8b02-c108a7c09538 · inbound

Training Language Models to Self-Correct via Reinforcement Learning cites this paper.

Training Language Models to Self-Correct via Reinforcement Learning Okapi: Instruction-tuned Large Language Models in Multiple Languages with Reinforcement Learning from Human Feedback

Reference 83

Resolution
verified exact
arxiv_id, observed 2026-05-17T12:04:10.549704Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=arxiv_source observed=2026-05-17T12:04:10.210508Z digest=sha256:35fca148076a5e88dffaf8cd7f8f8d289775e10e1681159187bf487c211bb01f

Observation 060b73f1-9848-4154-a328-ac2b062ff445 · inbound

AdaMCoT: Rethinking Cross-Lingual Factual Reasoning through Adaptive Multilingual Chain-of-Thought cites this paper.

AdaMCoT: Rethinking Cross-Lingual Factual Reasoning through Adaptive Multilingual Chain-of-Thought Okapi: Instruction-tuned Large Language Models in Multiple Languages with Reinforcement Learning from Human Feedback

Reference 4

Resolution
verified exact
arxiv_id, observed 2026-05-23T04:55:24.839070Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-23T04:55:04.067483Z digest=sha256:7f02f0910e9c86a45391843d88a60df4dac103c17f4569098d1788ae807d66e7

Observation bd3debf8-77b6-4a9f-a89c-07734bb1bd2a · inbound

Whose Truth? Pluralistic Geo-Alignment for (Agentic) AI cites this paper.

Whose Truth? Pluralistic Geo-Alignment for (Agentic) AI Okapi: Instruction-tuned Large Language Models in Multiple Languages with Reinforcement Learning from Human Feedback

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T23:23:32.490637Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:23:32.490637Z digest=sha256:02c42dec66985f9923330de1d5a4d2bdd9e66e19ea0329e86d373e5a0eaf830e

Observation 62ee54a1-3688-45e8-97f0-c9fe9286fb83 · inbound

TASE: Token Awareness and Structured Evaluation for Multilingual Language Models cites this paper.

TASE: Token Awareness and Structured Evaluation for Multilingual Language Models Okapi: Instruction-tuned Large Language Models in Multiple Languages with Reinforcement Learning from Human Feedback

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T23:21:23.366527Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:21:23.366527Z digest=sha256:b1a0be30233a978fbf014bf435f3822f5f25d8bb7c6b010a7abff635f8a7a905