Pith. sign in

Paper Citation Record · LEDGER

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models

As of 10 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 1 inbound Pith citation observation for arXiv:2512.14926.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2512.14926 v2

Coverage vector

measured 18 of 18 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-03T16:07:32.180007Z

measured 19 of 19 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T22:25:49.423121Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-06-28T22:32:44.691808Z

Reference resolution

18 of 18 outbound references displayed

  • verified exact1
  • verified fuzzy0
  • unresolved17
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 5f7508b3-83d3-44a1-a955-72120d106b22 · outbound

This paper cites LaVy: Vietnamese Multimodal Large Language Model.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models LaVy: Vietnamese Multimodal Large Language Model

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:31.610201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:31.610201Z digest=sha256:b89da2bf1e5e2ebfe6a45d788f1645493244a4c30c0c57f59f2b9a9b9a3fd58f

Observation 5d3d4449-0b89-4edb-80bc-0b05036a750c · outbound

This paper cites X-LLaV A: Optimizing bilingual large vision-language alignment.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models X-LLaV A: Optimizing bilingual large vision-language alignment

Reference 3

Resolution
verified exact
doi, observed 2026-08-03T16:08:19.731753Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-03T16:07:31.646452Z digest=sha256:f85c9b2398e36334b5bc6a479ca2e292e697bde6ebf9b2590c85f350f5f8a9f4

Observation c533da01-5c8f-46df-95a3-803620420f26 · outbound

This paper cites Chunyuan Li, Cliff Wong, Sheng Zhang, Naoto Usuyama, Haotian Liu, Jianwei Yang, Tristan Naumann, Hoifung Poon, and Jianfeng Gao.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models Chunyuan Li, Cliff Wong, Sheng Zhang, Naoto Usuyama, Haotian Liu, Jianwei Yang, Tristan Naumann, Hoifung Poon, and Jianfeng Gao

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:31.731286Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:31.731286Z digest=sha256:e62fa07ae619218d60da2ff0fdf98f8d5d9702242b3fae368c67cd99a36c93e7

Observation 16f70462-e368-479b-8ee2-4b583a58b48c · outbound

This paper cites Kangyu Zhu, Ziyuan Qin, Huahui Yi, Zekun Jiang, Qicheng Lao, Shaoting Zhang, and Kang Li.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models Kangyu Zhu, Ziyuan Qin, Huahui Yi, Zekun Jiang, Qicheng Lao, Shaoting Zhang, and Kang Li

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:31.769584Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:31.769584Z digest=sha256:fbfe9bb1337f8e3972e8995b09cd9a8757c97cbe4ff0de6b0a713db8be0910a0

Observation 24fcf355-63d9-4138-aa92-1b55db5d2d37 · outbound

This paper cites Lu, Bowen Chen, Andrew Zhang, Richard J.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models Lu, Bowen Chen, Andrew Zhang, Richard J

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:31.835260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:31.835260Z digest=sha256:be5e33bee7f7dcb3913e52677072e5d67766e2c0f1753ed8d09f3817d64220fd

Observation 9cbb5e7f-30bf-440e-ba2a-855e17bb2e5d · outbound

This paper cites URL https://doi.org/10.1038/ s41591-024-02857-3.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models URL https://doi.org/10.1038/ s41591-024-02857-3

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:31.877007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:31.877007Z digest=sha256:b206e57537205bedc394f30d81a2188e7e865cbeae264d78964e9f1dc4cb626c

Observation 5836a262-0c89-49df-b6ed-36cb5692bd22 · outbound

This paper cites doi: 10.18653/v1/2024.findings-emnlp.268.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models doi: 10.18653/v1/2024.findings-emnlp.268

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:31.924073Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:31.924073Z digest=sha256:63aac92077e39ead9ac4f133e0095e908f7240e43307e7a62a620f08e18bf9ab

Observation 19cd0887-5ae5-4e9e-a56a-e8cbeb8e2110 · outbound

This paper cites X-LLaVA: Optimizing Bilingual Large Vision-Language Alignment.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models X-LLaVA: Optimizing Bilingual Large Vision-Language Alignment

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:31.968873Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:31.968873Z digest=sha256:2cd5b8244aa22c4a6dc19156c083012ab2649e6b1c03bd08b328bf3ac1e00f8f

Observation 9cebc39b-e7f3-44d7-931b-035284aa7207 · outbound

This paper cites Anwer, Tim Baldwin, Michael Felsberg, and Fahad S.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models Anwer, Tim Baldwin, Michael Felsberg, and Fahad S

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:32.013279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:32.013279Z digest=sha256:81df3e09f89a77cad592dc07b72502befa9fddc26ad7dfe9af3683e4a34e19bd

Observation 17417c65-eed7-4054-8678-b36a85a47f69 · outbound

This paper cites Maya: An Instruction Finetuned Multilingual Multimodal Model.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models Maya: An Instruction Finetuned Multilingual Multimodal Model

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:32.033663Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:32.033663Z digest=sha256:5ee433b5fed46b4dc507b2192c625aa15615e58d7043471310fec906ba889560

Observation 50d2c4cc-33b9-43c8-9ee9-dd2b1e5a1aad · outbound

This paper cites Chitrarth: Bridging vision and language for a billion people.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models Chitrarth: Bridging vision and language for a billion people

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:32.067790Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:32.067790Z digest=sha256:de70139ea3abf727d9acd5b1e01a7b10b068e4f50f4f5e5c8aa4cc228d99f976

Observation 7d472efe-7ba9-45bf-8d68-4448c88b715b · outbound

This paper cites The question generation prompt is used to produce four candidate questions for each image during the dataset augmentation phase.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models The question generation prompt is used to produce four candidate questions for each image during the dataset augmentation phase

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:32.180007Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:32.180007Z digest=sha256:c0e4e25ff2f17742c91dbc74e33d92d71edb41cb403e5fa64da4bda92d229d23

Observation c3cfd856-15c2-484a-9111-350b4b13766b · outbound

This paper cites Rouge: A package for automatic evaluation of summaries.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models Rouge: A package for automatic evaluation of summaries

Reference 2002

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:32.088934Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:32.088934Z digest=sha256:b4172b10816da66487b0bcc0da5f6098bbc208d0077a2a9298a710566fc1eb82

Observation dfafbf25-8ee1-482d-b7b7-9e9204b343a5 · outbound

This paper cites Bert: Pre-training of deep bidirectional transformers for language understanding.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models Bert: Pre-training of deep bidirectional transformers for language understanding

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:32.145621Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:32.145621Z digest=sha256:f3310f6b5c61430d47ca803d305f540df4a861e84064c064a2f3f21de8120b20

Observation 56e94657-71ad-4ca5-b182-ef61ddfe9696 · outbound

This paper cites Learning Transferable Visual Models From Natural Language Supervision.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models Learning Transferable Visual Models From Natural Language Supervision

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:31.687214Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:31.687214Z digest=sha256:c1191670a082cd9c8dfe319341bc4c615c8140a6ba6110af3e3a99f86340f6f9

Observation 9d22b67e-869b-41a7-9e3a-8c0ae15fec3b · outbound

This paper cites Haotian Liu, Chunyuan Li, Yuheng Li, and Yong Jae Lee.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models Haotian Liu, Chunyuan Li, Yuheng Li, and Yong Jae Lee

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:31.721667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:31.721667Z digest=sha256:48348941c9f30d525ee5be09250be28d441cd5025bd330f82ed4d197b90505b4

Observation 938a7b14-f115-42cf-a7c5-8022e86ce656 · outbound

This paper cites an unresolved cited work.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models Unresolved cited work

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:31.549446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:31.549446Z digest=sha256:2da7936c03b5afc2448891c1ae9923c1ffec1460d41573d069d0a25d9eaa883c

Observation b49eb0df-c817-423c-b839-e3948df40c37 · outbound

This paper cites ISBN 979-8-89176-189-6.

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models ISBN 979-8-89176-189-6

Reference 2025

Resolution
unresolved
no resolver link, observed 2026-08-03T16:07:31.789054Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T16:07:31.789054Z digest=sha256:b9babca21411b5842513cfe8ff6704c0437be8973c4e6e12902665268e1a673f

Pith citing papers

Observation 9da6a4a3-173d-4b47-afb4-514a6b02791e · inbound

"\^{I}n\c{t}elegi Rom\^ane\c{s}te?'' A Recipe for Romanian Vision-Language Models cites this paper.

"\^{I}n\c{t}elegi Rom\^ane\c{s}te?'' A Recipe for Romanian Vision-Language Models Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-07-07T03:18:11.090558Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-28T22:25:49.423121Z digest=sha256:26b62ede4a7d141536ec32b0c0b72671002a719a6a65d5417221c7371760a200