Pith. sign in

Paper Citation Record · LEDGER

CyberV: Cybernetics for Test-time Scaling in Video Understanding

As of 20 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 4 inbound Pith citation observations for arXiv:2506.07971.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.07971 v1

Coverage vector

measured 66 of 66 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T05:26:47.320450Z

measured 70 of 70 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T02:11:48.455492Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T08:17:45.840937Z

Reference resolution

66 of 66 outbound references displayed

  • verified exact2
  • verified fuzzy14
  • unresolved49
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation b7185dab-cc29-44f0-aed7-77af05663516 · outbound

This paper cites Critique-out-Loud Reward Models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Critique-out-Loud Reward Models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:46.991810Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:46.991810Z digest=sha256:aab3b641a0ef654e706a424cb1618f360417edbd33feafc8a53505fb2eff1a21

Observation 5e3845e7-e9b5-42bb-816b-bb375d6c6faf · outbound

This paper cites Claude Team.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Claude Team

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.518617Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:46.997671Z digest=sha256:3a493d67147b2b9bc8318c3f81974ad09d1ced0e488b26b30da2b496aaf0aff0

Observation e740239e-8ac9-486c-9fa1-c8791206aeee · outbound

This paper cites An introduction to cybernetics.

CyberV: Cybernetics for Test-time Scaling in Video Understanding An introduction to cybernetics

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.003174Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.003174Z digest=sha256:423b3bfb82de1deb4e2aa51bfed964c15f56f0cfa77d8a306f4dacd81df69d85

Observation 2929c73e-7163-4694-b270-508417fda755 · outbound

This paper cites Qwen Technical Report.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Qwen Technical Report

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.008776Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.008776Z digest=sha256:446c6287d7d489566cd2009ef8d6e8ebdb2b2a0a6dc84b3fda67c71bad7d2dc8

Observation c4de9698-e180-4017-8a64-20932ec07567 · outbound

This paper cites Qwen2.5-VL Technical Report.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Qwen2.5-VL Technical Report

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.014066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.014066Z digest=sha256:0cb1d35aba1a9f2f78e6c0e87c5b4cd8eac57d715a205cef4f8bbf6d0d86ab81

Observation 18dedfcc-cf37-4917-9de4-ba0fdaf51c54 · outbound

This paper cites Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.019699Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.019699Z digest=sha256:b2b9d8928b638a9cc00c0bd054b3b07994bb2cdb812b243260fc472a67778cae

Observation 994a85ef-f28d-40c1-95b8-db86e8829a82 · outbound

This paper cites Large Language Monkeys: Scaling Inference Compute with Repeated Sampling.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Large Language Monkeys: Scaling Inference Compute with Repeated Sampling

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.025491Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.025491Z digest=sha256:d09226cdbc197008557a50b5425155c418f3954b4513751739092970f3e28fc9

Observation 58bd6a79-63cc-4f58-8fa3-bbd7fae87bb7 · outbound

This paper cites On the importance of being emergent.Constructivist Foundations, 5(2):89, March 2010.

CyberV: Cybernetics for Test-time Scaling in Video Understanding On the importance of being emergent.Constructivist Foundations, 5(2):89, March 2010

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.492129Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:47.030997Z digest=sha256:d5dd2f27148be4d64182b30b9817da28ea5012924a355ba5dffa230327e97064

Observation 6c5ab84d-8850-40dd-9b20-a4b9d5966bee · outbound

This paper cites Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.036084Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.036084Z digest=sha256:eeb758b6c9fb92b9f02c303d4ebc7c73d56949676b8a9aeefc902192f5b0b3c3

Observation b4960047-268e-4d75-b7d9-b582d9ccbe2f · outbound

This paper cites How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.

CyberV: Cybernetics for Test-time Scaling in Video Understanding How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.041414Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.041414Z digest=sha256:0c35fc4e8ce042ade3350a9646c2a1642fdcf27d506f3d596773c2d9edc71131

Observation eba9dc51-6926-4f79-af91-9d81a4c118ce · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.046212Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.046212Z digest=sha256:8a86be5f8f398b1da5f872982b9905a5ee77a0664844b301f8e8e2f5f2a1c7f0

Observation bf7bc706-83ea-43bc-ae03-0ce04f6be90c · outbound

This paper cites VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs.

CyberV: Cybernetics for Test-time Scaling in Video Understanding VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.051059Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.051059Z digest=sha256:60458dc5e7cea64878a2025db266a502053391099a65279382b33cb5329a4cbf

Observation 6438f68a-91c3-4f0e-b688-9341f1f30ad5 · outbound

This paper cites Video-of-thought: step-by-step video reasoning from perception to cognition.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-of-thought: step-by-step video reasoning from perception to cognition

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.457539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:47.056082Z digest=sha256:44cc6a4c4f855588c14d35b0e7beb1d71008495ec63a171db77b263c38233f6b

Observation f1438cd1-b6b3-4387-894d-4246da694cb6 · outbound

This paper cites Video-R1: Reinforcing Video Reasoning in MLLMs.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-R1: Reinforcing Video Reasoning in MLLMs

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.060972Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.060972Z digest=sha256:c5526cda445c343815001b39992da12254d2a9876e318f5069ccdd9ea8a72f97

Observation f693478b-31f6-475c-856e-3a13988d1d50 · outbound

This paper cites Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Do I Know This Entity? Knowledge Awareness and Hallucinations in Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.066169Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.066169Z digest=sha256:93017484b2d71c3b0e68d299dc0148b5eeaea9e7efdf6b971e26d5ab9629ec98

Observation cf788293-7850-47ac-bab6-645d0779f3b9 · outbound

This paper cites Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.442495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:47.071269Z digest=sha256:378ab303913ddf35fad9bb61a5f04827262e234cd9fc32b72a271a7391cf7a2a

Observation 747e27cb-f39e-420e-8639-33ce86441252 · outbound

This paper cites The boat/helmsman.

CyberV: Cybernetics for Test-time Scaling in Video Understanding The boat/helmsman

Reference 17

Resolution
verified exact
doi, observed 2026-08-07T05:26:47.424258Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:47.076321Z digest=sha256:a175c7bca596e1e95e371ace834142fa4dfceb1221e67cb4e990a85c1c430400

Observation 11f49cd3-e5d7-4800-b667-df25200b3118 · outbound

This paper cites Stream of search (sos): Learning to search in language.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Stream of search (sos): Learning to search in language

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.427236Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:47.081254Z digest=sha256:266714061dc81f8c58e86eb45b52c9ec8d03cc9fba13ac3c1e7a9007eed02e72

Observation fdb91667-117e-485c-b3d7-bd685ac7f5c9 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.085969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.085969Z digest=sha256:a49b8c1bbec93cb869adf919bde269bab0a9b1ccb5a7390069a491b231f002bd

Observation 1e477a11-c3be-4f89-8374-03516e599b7e · outbound

This paper cites Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Logic-in-Frames: Dynamic Keyframe Search via Visual Semantic-Logical Verification for Long Video Understanding

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.091033Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.091033Z digest=sha256:a47799bf85f75a8e5632f485915c8651620a1c3365cda6a789e61aa6ccf1ecd2

Observation 52664408-8232-4b51-b2a6-1494f9cc6290 · outbound

This paper cites Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Free Video-LLM: Prompt-guided Visual Perception for Efficient Training-free Video LLMs

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.096138Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.096138Z digest=sha256:e219519b762aecd63552132717c196033d670397d9ccb6e53b597753062d424f

Observation c4593a06-0e96-4413-bcfb-bf733a9b9095 · outbound

This paper cites WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs.

CyberV: Cybernetics for Test-time Scaling in Video Understanding WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.101151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.101151Z digest=sha256:196feda09e8ec955d4702f7daaa3523b06f98a12079b5ca908028688cf8c1c6a

Observation ae032cd7-8015-47c5-ab16-ab4aea6e38d8 · outbound

This paper cites Following clues, approaching the truth: Explainable micro-video rumor detection via chain-of-thought reasoning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Following clues, approaching the truth: Explainable micro-video rumor detection via chain-of-thought reasoning

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.411597Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:47.106051Z digest=sha256:75dc8af928f0e95839758f23718c065474624f90166da7e2b1ce7512707c5c25

Observation 86481275-9056-4f32-9893-441e6d675a85 · outbound

This paper cites CoS: Chain-of-Shot Prompting for Long Video Understanding.

CyberV: Cybernetics for Test-time Scaling in Video Understanding CoS: Chain-of-Shot Prompting for Long Video Understanding

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.111365Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.111365Z digest=sha256:cdffa2f88800549ba478f9eb868e5e7ae03be7d7ec9444c6eac2e0b79ce86e82

Observation 3afe48cc-0bfa-4fef-b495-e4872d0f038f · outbound

This paper cites Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.116523Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.116523Z digest=sha256:a88cf04a9d14e8ec0d3676e3215b12ee640eade2fb2cbbc1391eb93e1b9d222e

Observation e8f6dcc4-cdb6-4b49-9c46-79f8f5a8da40 · outbound

This paper cites Neural Networks with Recurrent Generative Feedback.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Neural Networks with Recurrent Generative Feedback

Reference 26

Resolution
metadata mismatch
local_arxiv, observed 2026-08-07T05:26:47.407547Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:47.121891Z digest=sha256:75a3130082df6237485451962ef091c40d6c9a6b9c6a08a1874953ccd8f31e3e

Observation 0f4d2b99-c812-4e5e-8f72-6dee08f56bee · outbound

This paper cites Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Memory-Space Visual Prompting for Efficient Vision-Language Fine-Tuning

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.126961Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.126961Z digest=sha256:6f90b5965f29503ffe60a16385a106d2b7b88e37280d32fd61623dab02a2b59d

Observation e179b3d8-d236-4c49-a55c-6fc28c022fd3 · outbound

This paper cites A Simple Model of Inference Scaling Laws.

CyberV: Cybernetics for Test-time Scaling in Video Understanding A Simple Model of Inference Scaling Laws

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.132278Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.132278Z digest=sha256:4974b451589c63b937c080f21d7a83bb3cfcdf0b5fcd943f24870e49dd2ddcb0

Observation 851b920e-39c9-4bc9-b8b4-ddee8a6e5fc0 · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

CyberV: Cybernetics for Test-time Scaling in Video Understanding LLaVA-OneVision: Easy Visual Task Transfer

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.137280Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.137280Z digest=sha256:a5fab3d615a10b5b60728a47d637a1fd508fafbb8b41458a84ee0255c8ba45b5

Observation b92b4578-1639-44c9-8c4e-488ab0c0a9d5 · outbound

This paper cites Aria: An Open Multimodal Native Mixture-of-Experts Model.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Aria: An Open Multimodal Native Mixture-of-Experts Model

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.142398Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.142398Z digest=sha256:a84dc95441053b9ddb06b8f46285e21198a60e9843e1da34beab4ee15ec0b22a

Observation 013a7f46-5688-41ee-8cbc-19d60450485c · outbound

This paper cites Mvbench: A comprehensive multi-modal video understanding benchmark.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Mvbench: A comprehensive multi-modal video understanding benchmark

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.148333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.148333Z digest=sha256:aba4b354d39dd5e77efc34e56f97a8ced2193c66d2af8f5f7009f6c95d03c8ca

Observation ae133fc9-d4c1-43ea-8968-351acf771948 · outbound

This paper cites Mvbench: A comprehensive multi-modal video understanding benchmark.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Mvbench: A comprehensive multi-modal video understanding benchmark

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.152919Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.152919Z digest=sha256:ab96399dbf7cc18224f43b66d307e64f5f5fac6918708965d3310e3bf420bcff

Observation af25d190-2708-432b-b466-11303fba6d59 · outbound

This paper cites VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.157304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.157304Z digest=sha256:0df8cd7855477c904654ff34478ebd8459aec430206bd7bda8bd6159cb47db52

Observation ba96c21b-1485-4d4c-a140-b80e1b4c14e3 · outbound

This paper cites Let’s verify step by step.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Let’s verify step by step

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.162872Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.162872Z digest=sha256:0ebf029f995210f5be7fed5955dea9baf45288f3b0adca97934b4fc0016f38b3

Observation cd4414fc-f965-40d8-988c-edcd08c27348 · outbound

This paper cites Vila: On pre-training for visual language models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Vila: On pre-training for visual language models

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.364823Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:47.167582Z digest=sha256:32261e1de46bdb65abe1d983152a36b4debcd410c9a60df2fb8d5bcd6acfdc9f

Observation 70bd4eff-189c-4e66-ba8b-fcf6c0b35422 · outbound

This paper cites Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Can 1B LLM Surpass 405B LLM? Rethinking Compute-Optimal Test-Time Scaling

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.172225Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.172225Z digest=sha256:bfd4066a38dec1dc73cea46c206706c091191af1f8438611aa70ed7354331cfc

Observation 8f9db7db-44f9-475e-9bfc-ce67c36f08ea · outbound

This paper cites Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.176832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.176832Z digest=sha256:fefbc7d16bfb4e4e82a0c4844b914dfb2eda952d9eed9c35974d9ca48d13c8e2

Observation 5caae8b8-9813-4dcc-bd72-5340ec991c81 · outbound

This paper cites MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding MLLM-Selector: Necessity and Diversity-driven High-Value Data Selection for Enhanced Visual Instruction Tuning

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.181794Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.181794Z digest=sha256:71ce5ac6a6e8ed87b27362f1842410673129e3c529b71c9e03b23bd8abcedac1

Observation 50ab3f98-e34b-4872-8763-610baf0a67b7 · outbound

This paper cites McCulloch and Walter Pitts.

CyberV: Cybernetics for Test-time Scaling in Video Understanding McCulloch and Walter Pitts

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.186636Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.186636Z digest=sha256:51631903a6b6331a9001b5f6a6dbfd3bd3b2fd7c5b9a5be6b5e583123d4988f3

Observation cb5e8886-3922-4cf0-987d-c1b25fd2cdf1 · outbound

This paper cites s1: Simple test-time scaling.

CyberV: Cybernetics for Test-time Scaling in Video Understanding s1: Simple test-time scaling

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.191423Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.191423Z digest=sha256:f73cf1ee2361a652c17156741873fbda21ab17c420ff7f1f43db72be4358eda8

Observation 72efaefc-21fd-4b76-99fe-2c3972bdbaef · outbound

This paper cites Hello gpt4-o.https://openai.com/index/hello-gpt-4o/, 2024.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Hello gpt4-o.https://openai.com/index/hello-gpt-4o/, 2024

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.348109Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:47.196230Z digest=sha256:5aac0b79c457b73aaf6ca8aa761e8dfd331bf520198feb9993f33fb8b1349199

Observation 22e546a7-2917-49a5-8cf7-7d55f3900988 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Direct preference optimization: Your language model is secretly a reward model

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.201026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.201026Z digest=sha256:9a84738513b1e0c94c26437b1292d448e1307e13f110ddd33d837b315db6f34a

Observation b049d93d-4725-4e24-8888-2c87fa20c840 · outbound

This paper cites Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Eve: Efficient Multimodal Vision Language Models with Elastic Visual Experts

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.205836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.205836Z digest=sha256:d5fb6036f73494cf310c84d5b6b5f9f4ac33703d95d59bc81a983ab4c33dd5a8

Observation e4785098-977e-4d34-b28f-be95bb55213d · outbound

This paper cites Proximal Policy Optimization Algorithms.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Proximal Policy Optimization Algorithms

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.210761Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.210761Z digest=sha256:11db94a01b9c8c6e6aa2a49c7a52a104ba9416cad8cd8a1a10e417a4fab9c72f

Observation 325e25aa-5e79-44e0-979d-8720389223f2 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.215800Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.215800Z digest=sha256:33fc76e91797f9e7453c8de899a29423bf7678322a93e87439e3db54c77025ef

Observation 236dae6e-f37c-4689-a97e-850002edef3b · outbound

This paper cites Long-vita: Scaling large multi-modal models to 1 million tokens with leading short-context accuray.arXiv preprint arXiv:2502.05177, 2025.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Long-vita: Scaling large multi-modal models to 1 million tokens with leading short-context accuray.arXiv preprint arXiv:2502.05177, 2025

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.220900Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.220900Z digest=sha256:3558fc4f71b3d0ed3adc5a5d94fbc03d7a4dc87a2e4bb98937370a99c2613079

Observation e951b058-651e-41cb-82f6-f9ca968c09dd · outbound

This paper cites Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-XL: Extra-Long Vision Language Model for Hour-Scale Video Understanding

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.226160Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.226160Z digest=sha256:5b48f4327ff31481871356687bb25bce0c65685c1be9a237f5b97d7321b1f3da

Observation 0df38b86-7c5b-4f31-af4f-94f8719d72c9 · outbound

This paper cites Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.231346Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.231346Z digest=sha256:97bd1c9ba0a3d0c6a1cf998093d9ea12d11f6958c412eb420c2aab3856536746

Observation 81506776-cb69-4f53-9508-b66c1acd9ec1 · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.236163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.236163Z digest=sha256:26c545aeb4e720cb947f3bebc59163f5fbceb716984f7d8dcbc8568de9f4e294

Observation 7e2787e1-62d6-4daf-9d48-12cc9422ec2c · outbound

This paper cites Solving math word problems with process- and outcome-based feedback.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Solving math word problems with process- and outcome-based feedback

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.241336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.241336Z digest=sha256:51ace05c7b6450082dfccd8f7096e14df4446c70129fec698c8a87865503632f

Observation 3437d662-c6b0-46cd-8d70-479da2f81a49 · outbound

This paper cites Cybernetics: Circular causal and feedback mechanisms in biological and social systems.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Cybernetics: Circular causal and feedback mechanisms in biological and social systems

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.322834Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:47.246193Z digest=sha256:2319dcfc67029faed9509d0f4c5b884ac3919e5bede913c01ee286eee9add7ce

Observation 91d4ed42-b3c9-4384-8bf2-7cad3e7b3fa4 · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.250907Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.250907Z digest=sha256:02579345b4ab1c988738184b548adf7ce2be0a9ca9399020b32be53ab3caec50

Observation f55b0907-0362-4df1-8774-85ba73fb327e · outbound

This paper cites Visionllm: Large language model is also an open-ended decoder for vision-centric tasks.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Visionllm: Large language model is also an open-ended decoder for vision-centric tasks

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.307116Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:47.256164Z digest=sha256:c978c5f79f50c9451c333ee8be7693f3642452d8984c88b7b2faaa4a760e88eb

Observation 0ffe3b2b-39e2-4b0e-9b9e-e069d30f6c33 · outbound

This paper cites Self-consistency improves chain of thought reasoning in language models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Self-consistency improves chain of thought reasoning in language models

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.261813Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.261813Z digest=sha256:39bd334483f28d0d062fdafe5e6dfff639116eab236babc8f07480e05f005927

Observation 61606932-3186-4d92-91fb-d4541afcc799 · outbound

This paper cites InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling.

CyberV: Cybernetics for Test-time Scaling in Video Understanding InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.266447Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.266447Z digest=sha256:984530a36c9e22e8b96d0eb23c5d655d295a9ef4fa4eab6e2df9e64da01b3409

Observation 16060295-c0bd-46b4-a319-e377a229e929 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Chain-of-thought prompting elicits reasoning in large language models

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.281545Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:47.271373Z digest=sha256:fca27978a53c5e27090ade9f6b2f4e4d4490ff3a56291ecf7ef6baaf4fd5eaf1

Observation 49ed97e7-5fef-42f6-8de4-acd32a68c974 · outbound

This paper cites Cybernetics or Control and Communication in the Animal and the Machine.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Cybernetics or Control and Communication in the Animal and the Machine

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.265217Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:47.275958Z digest=sha256:0d47a29b1147e8cce89b24af7ad256eabb84e4c07bd8658ae84e88747c5d36c4

Observation 0e4ced83-f7b3-4205-89b5-5186abd780c4 · outbound

This paper cites Controlmllm: Training-free visual prompt learning for multimodal large language models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Controlmllm: Training-free visual prompt learning for multimodal large language models

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.249410Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:47.280559Z digest=sha256:024186ddab1bc398b634eb77b0815016fe8425801f2dabd4d939942d7aef6914

Observation d98e0f41-98b9-4c0d-b213-7bde18df4df7 · outbound

This paper cites DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data.

CyberV: Cybernetics for Test-time Scaling in Video Understanding DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.285294Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.285294Z digest=sha256:e395773c27b24f1c5c493b9c7a7782160e093525a43b5f7025a15208f6a39798

Observation 29ae9f45-2e00-4a5d-9cbd-fea763364b39 · outbound

This paper cites VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding.

CyberV: Cybernetics for Test-time Scaling in Video Understanding VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.290148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.290148Z digest=sha256:d302e38c19cd3a33d6b3b6e7d099357924ce7a732918a64f9525fa093963c44d

Observation 2ebd99f9-284f-456e-9fb2-5a0f7fc30cb0 · outbound

This paper cites Video-llama: An instruction-tuned audio-visual language model for video understanding.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Video-llama: An instruction-tuned audio-visual language model for video understanding

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:26:48.233970Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:47.295054Z digest=sha256:a2a0ab01101945e61ee65b579b0338dac9b788c5246f9c28cafa114f39814d87

Observation cf0663c6-07a0-424d-a475-16f65e101b6b · outbound

This paper cites Long Context Transfer from Language to Vision.

CyberV: Cybernetics for Test-time Scaling in Video Understanding Long Context Transfer from Language to Vision

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.299651Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.299651Z digest=sha256:a576089c7476d98a918baf5d108f2a64b6ae657d3b81c2ab2a5b77a6edda5854

Observation d55a354c-3fae-4341-b0c8-0637b6366ea6 · outbound

This paper cites AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback.

CyberV: Cybernetics for Test-time Scaling in Video Understanding AdaRefiner: Refining Decisions of Language Models with Adaptive Feedback

Reference 63

Resolution
verified exact
local_arxiv, observed 2026-08-07T05:26:47.371796Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-08-07T05:26:47.304566Z digest=sha256:e567aeecb4bbed7eda801a6ab98e34ea96180bb047839983926cb52cd799e695

Observation 6b93e37e-a4f1-4806-a581-13cf263521b9 · outbound

This paper cites TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning.

CyberV: Cybernetics for Test-time Scaling in Video Understanding TinyLLaVA-Video-R1: Towards Smaller LMMs for Video Reasoning

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.309529Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.309529Z digest=sha256:d528baff3ebab1f42f3d213676e29704387c2024213e32d7af1748c7e010008c

Observation 0ac43119-00d2-4316-80ae-1ac7c5cda771 · outbound

This paper cites LLaVA-Video: Video Instruction Tuning With Synthetic Data.

CyberV: Cybernetics for Test-time Scaling in Video Understanding LLaVA-Video: Video Instruction Tuning With Synthetic Data

Reference 65

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.315568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.315568Z digest=sha256:32ccdbb763e88f8f52e389d0f7cf8b1e8022bba8026993111a9c0e46667e2a38

Observation 482ffa6f-a7bc-4d60-aff8-32ef23cb0176 · outbound

This paper cites InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models.

CyberV: Cybernetics for Test-time Scaling in Video Understanding InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-07T05:26:47.320450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:26:47.320450Z digest=sha256:d34b05d0d1d311d608687e9620097ef333c5680d0c98f24ea73be87bc84c5641

Pith citing papers

Observation eae3f730-7ef9-40ac-8040-03d74213e13a · inbound

Towards One-to-Many Temporal Grounding cites this paper.

Towards One-to-Many Temporal Grounding CyberV: Cybernetics for Test-time Scaling in Video Understanding

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-07-02T12:16:57.682594Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-06-28T02:11:48.455492Z digest=sha256:13f7e785ebb296d28386036bcc0103633a980e6ac2252e05b34754a88b30a20b

Observation 74dd834b-6366-4786-b43c-4902ac52591b · inbound

Watch, Remember, Reason: Human-View Video Understanding with MLLMs cites this paper.

Watch, Remember, Reason: Human-View Video Understanding with MLLMs CyberV: Cybernetics for Test-time Scaling in Video Understanding

Reference 229

Resolution
verified exact
arxiv_id, observed 2026-07-02T17:27:15.514528Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-06-27T22:00:28.350003Z digest=sha256:8047e5abcb0d7bd4b73c800df4b212d7332c613172c630cbe4a5ad16818b4d99

Observation 13131be7-d41c-4a63-b60c-6d48758620dd · inbound

Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning cites this paper.

Test-Time Scaling in Multimodal Foundation Models: A Comprehensive Survey of Generation and Reasoning CyberV: Cybernetics for Test-time Scaling in Video Understanding

Reference 61

Resolution
verified exact
arxiv_id, observed 2026-07-02T21:37:25.298267Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=arxiv_source observed=2026-06-27T19:36:57.231932Z digest=sha256:c4965184bec6781600b9b6e9c09442027c96cbb11111d8018db06771ddb6f4f3

Observation bec2ef43-3501-4268-ade0-ea680fe68fe0 · inbound

AVIS: Adaptive Test-Time Scaling for Vision-Language Models cites this paper.

AVIS: Adaptive Test-Time Scaling for Vision-Language Models CyberV: Cybernetics for Test-time Scaling in Video Understanding

Reference 34

Resolution
verified exact
arxiv_id, observed 2026-07-03T08:17:45.842398Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.

source=pdf_text observed=2026-06-27T10:47:41.183211Z digest=sha256:9da45f9c0c7adeb63bb6c7d2a2c60ff53002f5b3a69b6dc1c77f57debb684bcf