Pith. sign in

Paper Citation Record · LEDGER

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN

As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2505.17153.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.17153 v1

Coverage vector

measured 50 of 50 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T15:05:19.897437Z

measured 50 of 50 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

50 of 50 outbound references displayed

  • verified exact2
  • verified fuzzy5
  • unresolved43
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation edcb3ecf-1ee1-4680-b786-1a5fbc0e4f94 · outbound

This paper cites Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.863753Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.863753Z digest=sha256:c0e255ee497a0f1823fe62ddea9ad9eb0787efc9057a410e4f06646135b97293

Observation 20594c8e-cf54-4b7b-ab41-0c971e689852 · outbound

This paper cites BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.912119Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.912119Z digest=sha256:0bb55c687b3b6902d293e0bca02ee4ff702497c466347d07ca0fd9dd70f45d5e

Observation b8411c99-df34-483a-89a1-76374c5d0616 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:15.978469Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:15.978469Z digest=sha256:b151b47851396494a4837185ed543417db45d6a839a37b8c5b2862bf6e8669eb

Observation 2451d7b6-0fb5-48dc-b271-06680e0039ec · outbound

This paper cites Transformer Feed-Forward Layers Build Predictions by Promoting Concepts in the Vocabulary Space.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Transformer Feed-Forward Layers Build Predictions by Promoting Concepts in the Vocabulary Space

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:16.094881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:16.094881Z digest=sha256:7c081590ad895420ea3458ff41c9cf3deb15a07ebdd5a4a0b2f59a77b040e7bf

Observation 9fee41cc-b67c-4220-a614-8d07141047c6 · outbound

This paper cites Transformer Feed-Forward Layers Are Key-Value Memories.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Transformer Feed-Forward Layers Are Key-Value Memories

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:22.099888Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:16.177248Z digest=sha256:9a114fc9006f312f6dc28b0964a7aee92d30c550985271e0177a505d8411e455

Observation 3da8ab7f-1a4b-4b33-9fc6-607cd275d8a9 · outbound

This paper cites The Llama 3 Herd of Models.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN The Llama 3 Herd of Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:16.248909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:16.248909Z digest=sha256:9a445640ca9684d2f65b2fc304db582d609fc646115719c456319d60fb1313db

Observation 27bac971-3325-41f3-a048-39aeb616320d · outbound

This paper cites Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:16.333308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:16.333308Z digest=sha256:84267c789d2ff1be96b435c61a3c05161d8d6b5f1546941d8fae1e12bc1e4f41

Observation 091fe990-b33c-4595-91bd-3a51ae940bd7 · outbound

This paper cites OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:16.407357Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:16.407357Z digest=sha256:678bd160f89e13edfed7dac6af0e5dc147bdca3c508cbf6fd37ad84ccf42c4b2

Observation b369802f-7514-4d8c-bc95-d06f81b00da0 · outbound

This paper cites SparseAdapter: An Easy Approach for Improving the Parameter-Efficiency of Adapters.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN SparseAdapter: An Easy Approach for Improving the Parameter-Efficiency of Adapters

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:16.486061Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:16.486061Z digest=sha256:9c7f237df4b4bdbc6d361cb796e6a5bd3f549841dcf65b536d3d1489cedce215

Observation 44a2a934-5672-4d7b-8b2e-0756933028df · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Measuring Mathematical Problem Solving With the MATH Dataset

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:16.542905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:16.542905Z digest=sha256:05639d74a3decb03418e84b4be67b2486f99e15b270e6a62069a51ebdb5ee12e

Observation 66c33497-9e18-4736-96d2-6e9e11923946 · outbound

This paper cites Parameter-efficient transfer learning for nlp.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Parameter-efficient transfer learning for nlp

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:21.937018Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:16.629862Z digest=sha256:2b7e171f6ea099b9f1409ca7ea439e964b56070908c1d3ab9432d395086678b9

Observation c09dca73-b644-4614-87f3-03714e94a006 · outbound

This paper cites Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:16.707178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:16.707178Z digest=sha256:b155d420f2dfd28eb47bcb24eea6c61074597a015c3513843a64e5638da87c74

Observation b618ca45-392e-4a07-9b72-412fa770fcb1 · outbound

This paper cites OpenAI o1 System Card.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN OpenAI o1 System Card

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:16.872009Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:16.872009Z digest=sha256:504e8ff8688ff0b02def78cdd45d0502eb678c81ee402b189cb988fc978e800d

Observation b4b4d9fd-3564-4e50-8f30-2b84d5db40ff · outbound

This paper cites The Power of Scale for Parameter-Efficient Prompt Tuning.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN The Power of Scale for Parameter-Efficient Prompt Tuning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:16.951400Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:16.951400Z digest=sha256:d8555d5e93d0adbb009168b1f33f242f23c89c203d4d087321c7c25dc82d9927

Observation 34f5e305-0b0e-4771-9a15-bea1284fcc89 · outbound

This paper cites LLMs Can Easily Learn to Reason from Demonstrations Structure, not content, is what matters!.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN LLMs Can Easily Learn to Reason from Demonstrations Structure, not content, is what matters!

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:17.071531Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:17.071531Z digest=sha256:5ce8f86fcd41f49988681b0b7ad4daf6691d949896dbe096647c2ae89d670c16

Observation 68eeb38e-a341-4639-bb0b-0b8ce748747e · outbound

This paper cites Numinamath.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Numinamath

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:17.172094Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:17.172094Z digest=sha256:d4fbbb73deb24a0d24c037184fabcb92c199b35c6682f855d6a51baa41213e70

Observation 46ac53ae-08cc-4531-81a5-3f28b362e45f · outbound

This paper cites Prefix-Tuning: Optimizing Continuous Prompts for Generation.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Prefix-Tuning: Optimizing Continuous Prompts for Generation

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:17.235203Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:17.235203Z digest=sha256:baca8f61894a35e247ecd589aa68c18d7fc9cc3fed0a781105fc31a7587c3853

Observation 9cd70891-dba0-49ca-8880-a9e4d17bf1ab · outbound

This paper cites Alpacaeval: An automatic evaluator of instruction-following models, 2023.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Alpacaeval: An automatic evaluator of instruction-following models, 2023

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:17.316737Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:17.316737Z digest=sha256:7d4241d0d7e6db39a9fc267ff556dd8ceb534d0b3eb3e13e1d951d436654be79

Observation ff4bc00a-3230-4281-ab2e-6656d2c1f2bb · outbound

This paper cites Forgetting Transformer: Softmax Attention with a Forget Gate.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Forgetting Transformer: Softmax Attention with a Forget Gate

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:17.376218Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:17.376218Z digest=sha256:93f6548b5e9197600647d148cf6f76b6bb0762cb1b23f8e97b5cf7e325ea7e4a

Observation 230253f7-1030-4595-8aa5-ef821a7fa717 · outbound

This paper cites In-context Vectors: Making In Context Learning More Effective and Controllable Through Latent Space Steering.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN In-context Vectors: Making In Context Learning More Effective and Controllable Through Latent Space Steering

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:17.455869Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:17.455869Z digest=sha256:6c3d16631def2e87e873280a7330be38320e4b7e3db6289dd3261e2397092e3a

Observation ad3441ee-d468-4673-b568-576ea0b8e971 · outbound

This paper cites Parameter-Efficient Orthogonal Finetuning via Butterfly Factorization.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Parameter-Efficient Orthogonal Finetuning via Butterfly Factorization

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:17.543801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:17.543801Z digest=sha256:f9d7bf9256189ee7eeeb07f1846e387914e7abf972e29ff5074648f22487860a

Observation 733fb8d7-ec21-433b-b1a7-dec171a681e6 · outbound

This paper cites Aligning Large Language Models with Human Preferences through Representation Engineering.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Aligning Large Language Models with Human Preferences through Representation Engineering

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:17.598415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:17.598415Z digest=sha256:5a472b10247438ef14dc90fa862e971c114cca57872e30df0ef1921be8a03821

Observation 6c720b9a-7f7e-4f4a-8683-72bde472d96a · outbound

This paper cites Deconstructing Long Chain-of-Thought: A Structured Reasoning Optimization Framework for Long CoT Distillation.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Deconstructing Long Chain-of-Thought: A Structured Reasoning Optimization Framework for Long CoT Distillation

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:17.677275Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:17.677275Z digest=sha256:c860d744b16a460c54f4d4d8a73bcc05bd526ce6907f9a113989fe2671c78ac3

Observation bb867424-b9c0-40a4-91f1-230646a0278e · outbound

This paper cites RWKV: Reinventing RNNs for the Transformer Era.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN RWKV: Reinventing RNNs for the Transformer Era

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:17.747787Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:17.747787Z digest=sha256:b553373a5f8bc7d1ce2fe9ef800f42cb30567a113a9d0abeb76f5bb8aa640c68

Observation 125abb68-a687-4ad8-acb7-69af4274630c · outbound

This paper cites Fast Transformer Decoding: One Write-Head is All You Need.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Fast Transformer Decoding: One Write-Head is All You Need

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:17.803938Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:17.803938Z digest=sha256:1eaba88e61a4fe079c768197fbdfcd8bc9b97aebef1ff3e1ca2f8c28b7084803

Observation ba14f151-1384-4bf2-8424-f341d9f5056b · outbound

This paper cites GLU Variants Improve Transformer.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN GLU Variants Improve Transformer

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:17.887048Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:17.887048Z digest=sha256:bfd9d00d8b789c32d0a9c316877c67d180febd7fd320ee7f40732e6b8ccbcf87

Observation f37b9ff8-a8e2-4dad-b2d9-4f044e4e8287 · outbound

This paper cites LLM Braces: Straightening Out LLM Predictions with Relevant Sub-Updates.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN LLM Braces: Straightening Out LLM Predictions with Relevant Sub-Updates

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-08-07T15:05:20.572623Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:17.940629Z digest=sha256:022d21c19bc8444c4671927492bbf7660eb031feac8c6d30df6d90cfe12bc295

Observation 91217912-0b99-41be-a8ce-fef01a32ef9d · outbound

This paper cites Extracting Latent Steering Vectors from Pretrained Language Models.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Extracting Latent Steering Vectors from Pretrained Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:17.998310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:17.998310Z digest=sha256:4d2f46fd95469445ad7c83091ed15ad2c9df2008abc721f70e3d9b6c049c4d11

Observation 503f1712-bfa0-4fae-a5b4-ac58094778da · outbound

This paper cites Augmenting Self-attention with Persistent Memory.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Augmenting Self-attention with Persistent Memory

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:18.057429Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:18.057429Z digest=sha256:41047f21d00d2db2d32b697a4483baa52353d9937a5596b7e98b0eba136acbba

Observation b3b9e273-3a2e-4d4a-9d54-87aee7d81162 · outbound

This paper cites End-to-end memory networks.Advances in neural information processing systems , 28, 2015.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN End-to-end memory networks.Advances in neural information processing systems , 28, 2015

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:21.675450Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:18.129636Z digest=sha256:0c9fc1abcf65241100f6752b6cfe6b529d4b66fb088996594138aac8a6c76974

Observation 9d3f7704-a80b-4415-81ab-03d1b3823450 · outbound

This paper cites Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation Engineering.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation Engineering

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:18.186011Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:18.186011Z digest=sha256:fa72b2bedd4afe4b085259e457e588b59a1815427ae7cda5df4e60d22f9309dc

Observation 320dd58c-efa1-4828-bc2d-5b2f5235d66b · outbound

This paper cites Open Thoughts.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Open Thoughts

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:18.232468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:18.232468Z digest=sha256:60784eba1d011ae10fd31e114c99c9b834093817ed8303e99bd5358fddaca784

Observation 9e31af5f-ba6e-45b9-98da-6b8ec303106e · outbound

This paper cites Attention Is All You Need.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Attention Is All You Need

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:18.268620Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:18.268620Z digest=sha256:5e29dc29f0268ef369dc6687de7b50b4489521691aea0c8d8d8622d830719c89

Observation a3e006d8-133f-4a32-8f27-dc6c2ae53af5 · outbound

This paper cites AdaMix: Mixture-of-Adaptations for Parameter-efficient Model Tuning.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN AdaMix: Mixture-of-Adaptations for Parameter-efficient Model Tuning

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:18.346073Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:18.346073Z digest=sha256:03f893958003bf5ae851637c1390dda0472673d7dfb325284d00729a67c5d454

Observation 0017b253-c6cf-4eef-91a7-27d7029881db · outbound

This paper cites Latent Space Chain-of-Embedding Enables Output-free LLM Self-Evaluation.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Latent Space Chain-of-Embedding Enables Output-free LLM Self-Evaluation

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:18.423772Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:18.423772Z digest=sha256:1df417f6148f9de1ed9784ed5e357de925d4ab9bc03c5c1197c75cd6a76f876f

Observation dadb16df-3acd-428a-ae37-a59c1aa4f0ad · outbound

This paper cites Wong, Zhuosheng Zhang, and Rui Wang.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Wong, Zhuosheng Zhang, and Rui Wang

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:21.465900Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:18.497508Z digest=sha256:aa873f0379de02a20820a1774e65d9d48df2b80e68d59ef9c08fe9a45c75cd5d

Observation be08691d-74b4-4e02-8710-feccd04bb026 · outbound

This paper cites Chain-of-Thought Prompting Elicits Reasoning in Large Language Models.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Chain-of-Thought Prompting Elicits Reasoning in Large Language Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:18.633434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:18.633434Z digest=sha256:5e8b40cdd3d9742c6a2b96a0b8b50acb16d9c37bda9ab9abe057531bdcc59b10

Observation 8a891a60-d82e-4554-820c-e3eec9d5f64f · outbound

This paper cites Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:18.720509Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:18.720509Z digest=sha256:da7b2737bf5e658aedb6482c04091e96fa5f2f96f9a28292bb5909c071284e74

Observation a2ac8587-3ae2-4ad3-811c-031ed8cceb80 · outbound

This paper cites Advancing Parameter Efficiency in Fine-tuning via Representation Editing.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Advancing Parameter Efficiency in Fine-tuning via Representation Editing

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:18.775375Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:18.775375Z digest=sha256:3d760a72510e46dd6d9785ef375ee89ba2301303c013e8d143adaa7979af2f77

Observation 344a521c-fd11-4e3d-beb1-43cd82ff1f3f · outbound

This paper cites Manning, and Christopher Potts.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Manning, and Christopher Potts

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T15:05:21.254712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:18.852749Z digest=sha256:fe77f28bd82b4d9d212a08ec4f33c4cd19675aad4b9c388d040abd10c26eeefa

Observation 4abe153e-e8b6-4594-87b5-07c32f2a92a7 · outbound

This paper cites KV Shifting Attention Enhances Language Modeling.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN KV Shifting Attention Enhances Language Modeling

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:19.100540Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:19.100540Z digest=sha256:009a49a3381083a1f2ac700752ceb2271cea9b1a4ca62357c160d100b80f767b

Observation 68cc455c-744e-4eb2-b860-f4fe8f6ba44a · outbound

This paper cites A Survey on Knowledge Distillation of Large Language Models.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN A Survey on Knowledge Distillation of Large Language Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:19.185123Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:19.185123Z digest=sha256:9a220a75f9fe9caeb65970cf1da747a2fea19afdf05139f711ac8907459b8847

Observation 50c6d867-dd34-4e29-b1ff-b321fb8aa9d0 · outbound

This paper cites ReFT: Representation Finetuning for Language Models.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN ReFT: Representation Finetuning for Language Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:18.938632Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:18.938632Z digest=sha256:2176e9bb89e8e16c34b01571c62cbd3ab284da1f7df480ff9c432f7ce386b797

Observation 8271824a-779a-48a6-9695-a63abe4ecf7c · outbound

This paper cites LIMO: Less is More for Reasoning.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN LIMO: Less is More for Reasoning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:19.412270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:19.412270Z digest=sha256:b1fab1bcd900f598bd5c02361946dce0bd42a74274cf9cbc581f0e2f67814250

Observation 037e2569-19b9-4245-8b92-657cd2b491a9 · outbound

This paper cites Root mean square layer normalization.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Root mean square layer normalization

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:19.565050Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:19.565050Z digest=sha256:4790fcbf53d5a7e78fcc0c5f8996e900c7f6137d0e5a58eb96dc9b63bf580b88

Observation e7a9876b-4c3f-4e46-a80a-426c9a5170fa · outbound

This paper cites Qwen2.5 Technical Report.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Qwen2.5 Technical Report

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:19.290571Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:19.290571Z digest=sha256:26e4c1baf1d00d89dd4fd5d8a415f8af470697db7972d30dbdb08c69ed622fa7

Observation 4dea9049-7e97-4eee-b831-8dcb2bf744cd · outbound

This paper cites LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:19.897437Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:19.897437Z digest=sha256:f18777bfdc72677a4a6bd7d590102e28a5c71d10ff41f98c46a575542e6e1b9a

Observation f93021cc-42b0-443d-91f0-902852f32316 · outbound

This paper cites AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:19.743618Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:19.743618Z digest=sha256:2afbd9d952408d9710a021c3097bc739b4e9cf89a64b63e47293821252da174c

Observation 24cc940b-bbd8-451f-a97a-c0a53707b18a · outbound

This paper cites LoRA: Low-Rank Adaptation of Large Language Models.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN LoRA: Low-Rank Adaptation of Large Language Models

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-07T15:05:16.794991Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:05:16.794991Z digest=sha256:81e88695795edb913662157a2def30069f921058dac7568b4702df8719c4eb01

Observation 26176ccd-d43a-4b24-b6a3-2ac556b85e9f · outbound

This paper cites Embedding Trajectory for Out-of-Distribution Detection in Mathematical Reasoning.

Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN Embedding Trajectory for Out-of-Distribution Detection in Mathematical Reasoning

Reference 2024

Resolution
verified exact
local_arxiv, observed 2026-08-07T15:05:20.328237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-07T15:05:18.572631Z digest=sha256:3aa7863e59e6e55beafaafa60863fa884e5f4d02b9754ef9203442afbf121bf4

Pith citing papers

No inbound Pith citation observations are available.