{"as_of":"2026-08-21T17:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f5b08f79aa18a06773606321626afdd5a6bbdf93e782f9840be0f8907643fc7","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:03:23.250097Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.08307/citation-record","integrity":"/paper/2412.08307/integrity","json":"/paper/2412.08307/citation-record.json","paper":"/paper/2412.08307"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:03:22.436256Z","title":"Mc-llava: Multi-concept personalized vision-language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.436256Z"},"links":{"citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:bc7eb7d4e22838efd6a5ff7cc97acf5e69091a7a1cd4c5467c6e3217073e5d7c","observation_id":"30eef648-3d45-46c3-bbd2-169572f7c7c5","resolution":{"observed_at":"2026-08-11T18:03:22.436256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02185","last_updated":"2024-10-04T07:00:03Z","snapshot_observed_at":"2026-08-18T17:09:03.060687Z","submitted_at":"2024-10-03T04:01:14Z","title":"POSIX: A Prompt Sensitivity Index For Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02185","snapshot_observed_at":"2026-08-11T18:03:22.469462Z","title":"Posix: A prompt sensitivity index for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.469462Z"},"links":{"cited_paper":"/paper/2410.02185","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:fdc0075f45fbd158af12e3a236705d3aec116aadf36e9aaf2940fc2aa911ef67","observation_id":"c8d76988-40d4-42ca-ba0b-88bfe23208ae","resolution":{"observed_at":"2026-08-11T18:03:22.469462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-20T02:50:01.167264Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-11T18:03:22.525123Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.525123Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:00ffebd3f6c73d51eccd3d8c202e1a81bd3e2596322ca46461a63bfea1dcb545","observation_id":"71b020b1-6cf7-446e-9f1e-99d3d252a245","resolution":{"observed_at":"2026-08-11T18:03:22.525123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08714","last_updated":"2023-06-08T02:14:20Z","snapshot_observed_at":"2026-08-16T15:33:00.066338Z","submitted_at":"2023-05-15T15:19:08Z","title":"Sensitivity and Robustness of Large Language Models to Prompt Template in Japanese Text Classification Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08714","snapshot_observed_at":"2026-08-11T18:03:22.539505Z","title":"Sensitivity and robustness of large language models to prompt template in japanese text classification tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.539505Z"},"links":{"cited_paper":"/paper/2305.08714","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:1bd670bd2c490627e434026c8e30b156e1759043158dbced7c0022576f03d9b8","observation_id":"727b169a-47e8-49b8-964d-8bbdb9b750ea","resolution":{"observed_at":"2026-08-11T18:03:22.539505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04037","last_updated":"2024-09-12T19:54:37Z","snapshot_observed_at":"2026-08-20T08:08:27.599725Z","submitted_at":"2022-12-08T02:21:47Z","title":"Demystifying Prompts in Language Models via Perplexity Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04037","snapshot_observed_at":"2026-08-11T18:03:22.564900Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.564900Z"},"links":{"cited_paper":"/paper/2212.04037","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:4f6a184fa5b4847fddba3e8939699336eb9aff9faa60a740fba633e81eda746d","observation_id":"74f1b90a-d998-4d21-9a53-24d00ff0a45f","resolution":{"observed_at":"2026-08-11T18:03:22.564900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01967","last_updated":"2023-11-03T15:03:36Z","snapshot_observed_at":"2026-08-17T23:01:19.468562Z","submitted_at":"2023-11-03T15:03:36Z","title":"The language of prompting: What linguistic properties make a prompt successful?","version":1},"cited_work":{"arxiv_id":"2311.01967","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.01967","snapshot_observed_at":"2026-08-11T18:03:23.475851Z","title":"The language of prompting: What linguistic properties make a prompt successful?","venue":"cs.CL","work_id":"fca169c9-2b78-46c2-b0ac-df231cd09ec5","year":2023},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.670661Z"},"links":{"cited_paper":"/paper/2311.01967","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:55af763adac4a3442a6a3d52ae3a1019a066824c5bac1c165beed2911c14ad2a","observation_id":"f61515cc-88c9-4f50-8453-f6bab2cd4d0a","resolution":{"observed_at":"2026-08-11T18:03:23.497784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T18:03:22.698234Z","title":"Mimic-it: Multi-modal in-context instruction tuning, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.698234Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:3aa5b717c78eb04b03caa9f63491481620dd91ea32ac1619bd214b6ec711dfa5","observation_id":"38253995-78b9-43ca-8e9c-34e08fbf2b7f","resolution":{"observed_at":"2026-08-11T18:03:22.698234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-11T18:03:22.726488Z","title":"Seed- bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.726488Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:91e31eb84624069b83729c301e789700baae56edb0449bf1cdf88150f900f08a","observation_id":"1d211f89-446d-453c-bfb6-4df7a3a23281","resolution":{"observed_at":"2026-08-11T18:03:22.726488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-11T18:03:22.759469Z","title":"BLIP-2: bootstrapping language- image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.759469Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:39c6cdd63e716fe258dcd7c8919279b1ad14728ca38316f7c907f064ec4ae99c","observation_id":"bd859e7b-4303-43e9-85be-3d014470063d","resolution":{"observed_at":"2026-08-11T18:03:22.759469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20271","last_updated":"2025-02-22T14:02:39Z","snapshot_observed_at":"2026-08-17T12:09:40.331965Z","submitted_at":"2024-03-29T16:26:20Z","title":"Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20271","snapshot_observed_at":"2026-08-11T18:03:22.802828Z","title":"Draw-and-understand: Leveraging visual prompts to enable mllms to comprehend what you want","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.802828Z"},"links":{"cited_paper":"/paper/2403.20271","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:b54e86b6f786264b8bdc2801e699a64b032faab9cf1b44afed684146a273c4ab","observation_id":"892510f2-451f-46b1-8d14-8e4387de93e3","resolution":{"observed_at":"2026-08-11T18:03:22.802828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10638","last_updated":"2025-03-19T05:52:59Z","snapshot_observed_at":"2026-08-16T13:42:42.381564Z","submitted_at":"2024-06-15T13:58:26Z","title":"Unveiling the Ignorance of MLLMs: Seeing Clearly, Answering Incorrectly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10638","snapshot_observed_at":"2026-08-11T18:03:22.817035Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.817035Z"},"links":{"cited_paper":"/paper/2406.10638","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:22f99a3c8b9495646d6596bea568f903db6ba1b543136a54f99c4fcc7ad50d1d","observation_id":"d192c475-6245-427a-939c-92dcdf3f2e87","resolution":{"observed_at":"2026-08-11T18:03:22.817035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08786","last_updated":"2022-03-03T12:10:58Z","snapshot_observed_at":"2026-08-18T15:42:46.886862Z","submitted_at":"2021-04-18T09:29:16Z","title":"Fantastically Ordered Prompts and Where to Find Them: Overcoming Few-Shot Prompt Order Sensitivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08786","snapshot_observed_at":"2026-08-11T18:03:22.832745Z","title":"Fantastically ordered prompts and where to find them: Overcoming few-shot prompt order sensitivity","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.832745Z"},"links":{"cited_paper":"/paper/2104.08786","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:0195c677416e60830f3693fc2c2ccb29dd1c0aea1134f94553ad07e4b9569952","observation_id":"6885cc57-b432-4ad9-8749-1deb724dae92","resolution":{"observed_at":"2026-08-11T18:03:22.832745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02363","last_updated":"2024-07-24T02:36:07Z","snapshot_observed_at":"2026-08-17T01:08:28.469407Z","submitted_at":"2024-05-03T05:09:54Z","title":"LLM as Dataset Analyst: Subpopulation Structure Discovery with Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02363","snapshot_observed_at":"2026-08-11T18:03:22.848861Z","title":"Llm as dataset analyst: Subpopulation structure discovery with large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.848861Z"},"links":{"cited_paper":"/paper/2405.02363","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:09392a35a5b97c3ade82be9fe56d0a5a5defd43a3ae693d823d5858487aac4de","observation_id":"e3995c41-b717-46a7-aee2-eeb732b4bd12","resolution":{"observed_at":"2026-08-11T18:03:22.848861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:03:23.958077Z","title":"m&m’s: A benchmark to evaluate tool-use for multi-step multi-modal tasks","venue":null,"work_id":"1a1b705f-626e-4944-89d4-06df79bb36b2","year":2024},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.861857Z"},"links":{"citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:d7f9852c21c20694d861747cc4402f481748f87bc7537b518849bae899c1131d","observation_id":"cc2f8e6b-862c-4dd9-ad4d-c656dc517d3c","resolution":{"observed_at":"2026-08-11T18:03:24.005992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:03:23.891593Z","title":"What makes chain-of- thought prompting effective? a counterfactual study","venue":null,"work_id":"2680e98e-ac07-465e-a233-1b355be1187c","year":2023},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.895898Z"},"links":{"citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:ab995299f3b58c13668e6e04fbde463d0df3b6cfda8573d65ee18f0f8e064e89","observation_id":"23712d74-aaa0-4c24-aca8-27258a256804","resolution":{"observed_at":"2026-08-11T18:03:23.920333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18799","last_updated":"2024-09-09T16:00:04Z","snapshot_observed_at":"2026-08-19T08:24:56.889947Z","submitted_at":"2023-11-30T18:43:51Z","title":"X-InstructBLIP: A Framework for aligning X-Modal instruction-aware representations to LLMs and Emergent Cross-modal Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18799","snapshot_observed_at":"2026-08-11T18:03:22.912520Z","title":"Joty, Ran Xu, Silvio Savarese, Caiming Xiong, and Juan Carlos Niebles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.912520Z"},"links":{"cited_paper":"/paper/2311.18799","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:5ba72235d902f6e15b4b70764b0abb9708b54eddc58df937aac8284435b1e42d","observation_id":"c7d9c0ca-fa84-4fcc-9c2c-24f50449ee61","resolution":{"observed_at":"2026-08-11T18:03:22.912520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-18T22:28:17.054690Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06065","snapshot_observed_at":"2026-08-11T18:03:22.960948Z","title":"Benchmarking prompt sensitivity in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.960948Z"},"links":{"cited_paper":"/paper/2502.06065","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:cb14a7db559c443a24ef231da295b028093cd6327e3bcfd06d2bbe145fa856cf","observation_id":"238224de-efcc-4bbb-b2f5-8e851586d489","resolution":{"observed_at":"2026-08-11T18:03:22.960948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06766","last_updated":"2024-06-06T19:01:37Z","snapshot_observed_at":"2026-08-20T02:12:40.856578Z","submitted_at":"2024-01-12T18:58:26Z","title":"Mind Your Format: Towards Consistent Evaluation of In-Context Learning Improvements","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06766","snapshot_observed_at":"2026-08-11T18:03:23.086225Z","title":"Mind your format: Towards consistent evaluation of in-context learning improvements","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:23.086225Z"},"links":{"cited_paper":"/paper/2401.06766","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:754e5d37e10088782bb469588a2b483af7a76f92b5c8070daf921e7231981247","observation_id":"6628a6c9-03d8-42b3-a6ad-2eec363cc127","resolution":{"observed_at":"2026-08-11T18:03:23.086225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T18:03:23.141039Z","title":"Qwen2-vl: Enhanc- ing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:23.141039Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:6587d0080272bfcae6dbdb9a8ae5bc03ae8579f4e139207447cf03fbaa9458d8","observation_id":"0ace4f0e-b5ef-4ba9-9940-85c9ad3659f6","resolution":{"observed_at":"2026-08-11T18:03:23.141039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11775","last_updated":"2025-01-27T06:25:11Z","snapshot_observed_at":"2026-08-16T13:42:09.278592Z","submitted_at":"2024-06-17T17:32:42Z","title":"Task Me Anything","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11775","snapshot_observed_at":"2026-08-11T18:03:23.176924Z","title":"Task me anything","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:23.176924Z"},"links":{"cited_paper":"/paper/2406.11775","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:d12a44d51767d7fe75dc13b52168f6ca6e69a9e9826849c2e829965c4a94d772","observation_id":"60f3acee-f860-4bfc-954e-be4d3b88ffb0","resolution":{"observed_at":"2026-08-11T18:03:23.176924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03882","last_updated":"2024-02-22T01:40:35Z","snapshot_observed_at":"2026-08-21T08:26:34.117376Z","submitted_at":"2023-09-07T17:44:56Z","title":"Large Language Models Are Not Robust Multiple Choice Selectors","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03882","snapshot_observed_at":"2026-08-11T18:03:23.211190Z","title":"On large language models’ selection bias in multi-choice questions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:23.211190Z"},"links":{"cited_paper":"/paper/2309.03882","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:95926cca877a2ca0aa731ff95d46c3c80a06211b9f7b78892d2fae406f402f51","observation_id":"0008e30c-2ecc-4df8-85c1-79c3cc58b7b6","resolution":{"observed_at":"2026-08-11T18:03:23.211190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T18:03:23.227142Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:23.227142Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:12bdbce46bdf7a2aa8ef67b5c51863fb110b9dd6cf879fcc5df36d782ce811c9","observation_id":"bd150fba-9ea1-47ed-a48d-7b06b5411614","resolution":{"observed_at":"2026-08-11T18:03:23.227142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12405","last_updated":"2024-10-16T09:38:13Z","snapshot_observed_at":"2026-08-20T00:22:48.174101Z","submitted_at":"2024-10-16T09:38:13Z","title":"ProSA: Assessing and Understanding the Prompt Sensitivity of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12405","snapshot_observed_at":"2026-08-11T18:03:23.238535Z","title":"Prosa: Assessing and understanding the prompt sensitivity of llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:23.238535Z"},"links":{"cited_paper":"/paper/2410.12405","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:10660ed561b5559fec915de5d7e889841343542f208209f33b356f4fca1a76b0","observation_id":"44282cb8-b209-4021-acf4-b658edb810d5","resolution":{"observed_at":"2026-08-11T18:03:23.238535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08207","last_updated":"2022-03-17T17:53:01Z","snapshot_observed_at":"2026-08-14T04:21:28.978034Z","submitted_at":"2021-10-15T17:08:57Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08207","snapshot_observed_at":"2026-08-11T18:03:23.042512Z","title":"Multitask prompted training enables zero-shot task generalization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:23.042512Z"},"links":{"cited_paper":"/paper/2110.08207","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:fffaa3145aa124c1fc91c2ccd372369eeb92d6631b26d444c135818e1a989e0e","observation_id":"48e7bb19-ea13-4484-a973-706e8e2b0e26","resolution":{"observed_at":"2026-08-11T18:03:23.042512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-16T13:55:33.670920Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-11T18:03:22.645911Z","title":"What matters when building vision-language models? arXiv preprint arXiv:2405.02246,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.645911Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:b68a81621a708768ba01a3f1b3b904441520a1b57bb2afbf5a63469f3c8ac53a","observation_id":"f787eb87-748d-49bb-a266-288d1fe1fee5","resolution":{"observed_at":"2026-08-11T18:03:22.645911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-11T18:03:22.621698Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.621698Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:5dc296b2f3c1700749b724e456ce0687a8f775e082202d4752919cc05db52f76","observation_id":"4215bf85-ded9-40f6-9e0c-ca1e6f48563f","resolution":{"observed_at":"2026-08-11T18:03:22.621698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T18:03:22.595202Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.595202Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:a976dd13123c2fa874e36942cf811f22cc57f9fc9e3b01788c14c43439c78a2e","observation_id":"4d106d51-ccd8-4f5b-bbf1-ab86482f5e93","resolution":{"observed_at":"2026-08-11T18:03:22.595202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T18:03:22.443790Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.443790Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:45082b107f5c26f24477b6037e6aeef07559ebb7e6279ed80165c9b891ea8272","observation_id":"5b33702f-5868-41dd-891b-12eae32a2e59","resolution":{"observed_at":"2026-08-11T18:03:22.443790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-11T18:03:22.501036Z","title":"Grounding- prompter: Prompting llm with multimodal information for temporal sentence grounding in long videos, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:22.501036Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:6fe217cd2d8bfa7c516db15677a4570bcd384e2ac4c3ae49445ff5d260d0b4f6","observation_id":"d37fd50e-4050-4445-a0b4-86665cfa144d","resolution":{"observed_at":"2026-08-11T18:03:22.501036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-11T18:03:23.010587Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:23.010587Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:4c93f69ede8647cbf369ad8bf16772a5b2939cea7180e5f927e607c1d6f54775","observation_id":"c7344e08-9461-48d3-8f45-a6e95f959a77","resolution":{"observed_at":"2026-08-11T18:03:23.010587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:03:23.837874Z","title":null,"venue":null,"work_id":"f1213a55-0ce4-4f81-8aad-bc1056de3301","year":1920},"citing_paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model","version":3},"reference_index":3360,"source":"pdf_text","source_observed_at":"2026-08-11T18:03:23.250097Z"},"links":{"citing_paper":"/paper/2412.08307"},"observation_digest":"sha256:28a802f4fffed4a1435342c6d92a1afcf15d087ff547e5661a6aa43b40e2929e","observation_id":"cc73d18a-015a-4dfb-8bb4-b8101aa3fadc","resolution":{"observed_at":"2026-08-11T18:03:23.860969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.08307","last_updated":"2025-04-08T08:30:30Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T21:22:33.189437Z","submitted_at":"2024-12-11T11:39:42Z","title":"Investigating the Scaling Effect of Instruction Templates for Training Multimodal Language Model"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2412.08307."}