{"as_of":"2026-08-18T09:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a5606af4d9d0723879ac8d5921396768c8a73550b267cc249e797178370c91d5","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:24:53.697821Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.15624/citation-record","integrity":"/paper/2504.15624/integrity","json":"/paper/2504.15624/citation-record.json","paper":"/paper/2504.15624"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:53.508928Z","title":"Facexbench: Evaluating multimodal llms on face understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.508928Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:3f08f5f30c0f36c57c4bae5a284699806bcc0437cc50d03d575c5d059bc91206","observation_id":"003f1676-ad98-47bf-b6c9-d51a5e1ec0f4","resolution":{"observed_at":"2026-08-16T11:24:53.508928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20717","last_updated":"2024-10-28T04:19:32Z","snapshot_observed_at":"2026-08-17T13:00:32.428107Z","submitted_at":"2024-10-28T04:19:32Z","title":"Face-MLLM: A Large Face Perception Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20717","snapshot_observed_at":"2026-08-16T11:24:53.513242Z","title":"Face- mllm: A large face perception model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.513242Z"},"links":{"cited_paper":"/paper/2410.20717","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:88b1093d9f7cb8ab95765209385d8916cd994bb7a209a2a6b07ece37484a809e","observation_id":"c55908f8-8390-4a32-8b9c-956a993c15b6","resolution":{"observed_at":"2026-08-16T11:24:53.513242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09158","last_updated":"2026-05-09T06:28:46Z","snapshot_observed_at":"2026-08-17T13:39:13.149690Z","submitted_at":"2025-03-12T08:33:46Z","title":"FaVChat: Hierarchical Prompt-Query Guided Facial Video Understanding with Data-Efficient GRPO","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09158","snapshot_observed_at":"2026-08-16T11:24:53.517329Z","title":"Favchat: Unlocking fine-grained facail video understanding with multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.517329Z"},"links":{"cited_paper":"/paper/2503.09158","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:4d7d351accddc37a19e8c63bb2d99261768a025d19f3b28d6895986208c4672e","observation_id":"cbd471f6-cbb9-4ff3-a666-acbf55b4a1f4","resolution":{"observed_at":"2026-08-16T11:24:53.517329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11424","last_updated":"2024-08-21T08:28:40Z","snapshot_observed_at":"2026-08-16T13:24:58.394231Z","submitted_at":"2024-08-21T08:28:40Z","title":"EMO-LLaMA: Enhancing Facial Emotion Understanding with Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11424","snapshot_observed_at":"2026-08-16T11:24:53.521271Z","title":"Emo-llama: Enhancing facial emotion understanding with instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.521271Z"},"links":{"cited_paper":"/paper/2408.11424","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:bee4f3b98f5ccba5ed886a415589a715231287a0e89bf36cfced9aa6601c8587","observation_id":"70c70e5f-92d2-40f5-a92e-1b3dadbbd9d4","resolution":{"observed_at":"2026-08-16T11:24:53.521271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-16T11:24:53.525193Z","title":"Open- flamingo: An open-source framework for training large autoregressive vision- language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.525193Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:79902ebede2626f50d2a14dc4450912d0760efc9b82aafa051ba4c8e28cdc711","observation_id":"16743285-a98a-481c-8fcd-47cf3bc3ae4a","resolution":{"observed_at":"2026-08-16T11:24:53.525193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.302690Z","title":"Visual instruction tuning","venue":null,"work_id":"b13e7d76-d99e-4741-a7e0-e7bbae204b49","year":2023},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.529154Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:bafc24e3b1533ab98d11114f48f26daa52984420e3a688bde018a5f42ec6ad29","observation_id":"ac7b534f-4c34-4db2-8616-3313911510ae","resolution":{"observed_at":"2026-08-16T11:24:54.305708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:53.532784Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.532784Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:ebd31bf9242909571cb5ff587e9b6d62bed4582e5b696f3241b1add6aad805aa","observation_id":"4075910d-50fb-47de-ac7e-a18264d5e592","resolution":{"observed_at":"2026-08-16T11:24:53.532784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02765","last_updated":"2025-01-06T05:15:59Z","snapshot_observed_at":"2026-08-14T12:32:34.328935Z","submitted_at":"2025-01-06T05:15:59Z","title":"Visual Large Language Models for Generalized and Specialized Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02765","snapshot_observed_at":"2026-08-16T11:24:53.536150Z","title":"Visual large language models for generalized and specialized applications","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.536150Z"},"links":{"cited_paper":"/paper/2501.02765","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:4b40eb4cbe7a47aae6a91549d3013daead7e4a375114a580f6ea64728fed64d5","observation_id":"46013e8b-f1a1-4a6f-93f7-2a2aad8421d5","resolution":{"observed_at":"2026-08-16T11:24:53.536150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:53.539671Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.539671Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:f0c5970d42c0a171d68a54b8ced20e7bdf1603dffa0cc9c79a83e4d4268a570f","observation_id":"2edbff60-3d85-4a88-b8fb-da8af66dae09","resolution":{"observed_at":"2026-08-16T11:24:53.539671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.281560Z","title":"Vcoder: Versatile vision encoders for multimodal large language models","venue":null,"work_id":"8c0decce-ed4b-4527-a560-12c37a50877e","year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.542884Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:89648e138eda02c47e7e34f9bb2c47c5877a1f1c5edb90d63886401fb551b490","observation_id":"87d35aa3-53c4-4611-8b07-f5f83b08715e","resolution":{"observed_at":"2026-08-16T11:24:54.284888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:53.546187Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.546187Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:42fa0d4c7ab74383323f5e557ba0392283c4deb32ffbfdc8495ea6bbd8f5e125","observation_id":"c34e4181-6768-4dd6-9df0-0bd0d559b1cb","resolution":{"observed_at":"2026-08-16T11:24:53.546187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04236","last_updated":"2025-03-02T09:39:57Z","snapshot_observed_at":"2026-08-16T14:20:53.769481Z","submitted_at":"2024-02-06T18:43:48Z","title":"CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04236","snapshot_observed_at":"2026-08-16T11:24:53.549430Z","title":"Cogcom: Train large vision-language models diving into details through chain of manipulations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.549430Z"},"links":{"cited_paper":"/paper/2402.04236","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:fde0c55c1056b78255597656c5f9e611e64d5e3ad5f90523505f0ae2c3a9f648","observation_id":"2240f453-8216-4db9-a520-a9bec520dec5","resolution":{"observed_at":"2026-08-16T11:24:53.549430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T11:24:53.552822Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.552822Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:0e87a32aa98fc0ebc64c4fc71f6ba7371a57f90ca82054688971ddef9193943e","observation_id":"544ef856-1577-49c6-b3fb-5285396eb874","resolution":{"observed_at":"2026-08-16T11:24:53.552822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-16T11:24:53.556124Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.556124Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:af75f625330f6af072399dfa79fcbd254bdc80bce42bd324f032d0f5b7416d5b","observation_id":"cbc2656a-0d78-421c-91a9-48172c79843a","resolution":{"observed_at":"2026-08-16T11:24:53.556124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:53.559291Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.559291Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:8b6403b5bc66e8726a03ccacabdcd3406fb88423130dd14fe22e5582228102d2","observation_id":"585e1b60-d5ec-4824-8e8d-33c0c60eea72","resolution":{"observed_at":"2026-08-16T11:24:53.559291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:53.562392Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.562392Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:1ef9b7d8e5ef777cd20005024150f46a3eb9c40bfb5c862f4dd19fbf575b4366","observation_id":"f2330d3b-d5ff-4178-8b4e-383aaf5573be","resolution":{"observed_at":"2026-08-16T11:24:53.562392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-16T17:13:28.893408Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-16T11:24:53.565583Z","title":"mplug-owl: Modular- ization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.565583Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:4731e1cbc478c6747bc11c21d59dfc059cf16f9abb6813d37fdf74cbaa46350e","observation_id":"7a28999c-b430-4793-a13b-0cacc6200e2a","resolution":{"observed_at":"2026-08-16T11:24:53.565583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:53.569251Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.569251Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:5d122096c6c0909e83c32d6c7e3055b4d19bc8e482bc91a03fe198586b146930","observation_id":"ef6e2b7f-2c86-4f95-ac15-4edd82480d45","resolution":{"observed_at":"2026-08-16T11:24:53.569251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.248748Z","title":"Lion: Empowering multimodal large language model with dual-level visual knowl- edge","venue":null,"work_id":"718681f9-358f-4fc9-91cf-2aa6490493ad","year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.572636Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:945dde80dd408bace1e4b381ef1273d86cbef75722d6ed6ffc8b35d25a7cc4bc","observation_id":"d43aed7b-a458-46b0-b326-1e90910b3f36","resolution":{"observed_at":"2026-08-16T11:24:54.252144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-16T11:24:53.575711Z","title":"Minigpt-v2: large language model as a unified interface for vision- language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.575711Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:782fa60180b1e385459a5e94c8b47a5b8e845bc29bcf8dd502aec93e0569c0f6","observation_id":"092a2334-530a-44d1-a585-d7f5a859f5c5","resolution":{"observed_at":"2026-08-16T11:24:53.575711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.239406Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"10b38a66-5e74-46eb-9ef1-118081b875f4","year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.579312Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:ce82c4fd59ce8d3cafb73af73e806dec2b577d46ae9bb1a9228cdad08e192daa","observation_id":"dfc45496-c8f6-426d-831b-6e383433b020","resolution":{"observed_at":"2026-08-16T11:24:54.242612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15947","last_updated":"2024-12-23T08:05:14Z","snapshot_observed_at":"2026-08-06T02:31:58.372974Z","submitted_at":"2024-01-29T08:13:40Z","title":"MoE-LLaVA: Mixture of Experts for Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15947","snapshot_observed_at":"2026-08-16T11:24:53.582221Z","title":"Moe-llava: Mixture of experts for large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.582221Z"},"links":{"cited_paper":"/paper/2401.15947","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:78685892e2235eb78569ef0fa10a93fe7b8a223c1cb4eb0e3f13c99684affd8f","observation_id":"5f74f07f-2cab-4692-9b80-f10acccb1f34","resolution":{"observed_at":"2026-08-16T11:24:53.582221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-16T11:24:53.585558Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.585558Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:2e1b5db0330111727c54070af98d812e5b6a29efa3742fc4c916a79d0006d7bc","observation_id":"aa924b58-fb9d-4292-a756-9f4c8c8c4f2f","resolution":{"observed_at":"2026-08-16T11:24:53.585558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-16T11:24:53.588905Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.588905Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:93901d097fcdff3b6fec9ea4c91f0e5159f459b16d724f365388c80fb37b0bf9","observation_id":"83f625b7-d49c-4d49-9556-47597e606d4d","resolution":{"observed_at":"2026-08-16T11:24:53.588905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-08-17T23:18:43.192721Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-16T11:24:53.592303Z","title":"Mantis: Interleaved multi-image instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.592303Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:6357114d267e46a143cb80491dd70b9aa088738ad4b0f048c2301bc4e1b2ebdc","observation_id":"47f935ce-e833-4e43-b5d3-7b3c328e7133","resolution":{"observed_at":"2026-08-16T11:24:53.592303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.230146Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"6793598e-a99e-4cbc-b551-a1baec6224ae","year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.595487Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:9647fd955af4acb43ed271c96d222e1f610997c86bda4649f67496f13e3c1c03","observation_id":"2fc529ec-1a6e-4d32-87fc-fbe7e1a2f4ce","resolution":{"observed_at":"2026-08-16T11:24:54.233439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-16T11:24:53.598754Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.598754Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:205a0d553ad8d591e2b6a48bc21460a6c86e9d512857f72a26534876a324fb15","observation_id":"c70f398e-67df-45db-9aff-f9a824ac63d9","resolution":{"observed_at":"2026-08-16T11:24:53.598754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-16T11:24:53.602074Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.602074Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:0b8c918555d3d225d225c9b6e891f67b382b7fbb9e2d3810afe6463828097971","observation_id":"688818ff-96ec-4e24-ba0e-18d65a22de72","resolution":{"observed_at":"2026-08-16T11:24:53.602074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.220493Z","title":"Deepveil: deep learning for identification of face, gender, expression recognition under veiled conditions","venue":null,"work_id":"0d6528e2-cf4d-49d9-8842-5f1b9c1c81ee","year":2022},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.605335Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:6f8de90f94061d34d2e758b9aacee7483916b26f6ef6f108cf409a36a939313e","observation_id":"dea68062-72c4-405f-8db9-8744b187c9e7","resolution":{"observed_at":"2026-08-16T11:24:54.223774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.210901Z","title":"Spl- net: Spatial-semantic patch learning network for facial attribute recognition with limited labeled data","venue":null,"work_id":"53c6e193-e41e-45ec-a37e-6d6a7e2cbfc8","year":2023},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.608240Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:a9afb9117740c27485370756cd62600c88954ae1068ed58a6151ae7b187f08ad","observation_id":"294468b2-398c-46e8-9cb2-117051d19e51","resolution":{"observed_at":"2026-08-16T11:24:54.214140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.200096Z","title":"Logical consistency and greater descriptive power for facial hair attribute learning","venue":null,"work_id":"cd3e8d06-fbdd-44b1-ba85-42c99db197a2","year":2023},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.611260Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:a1c46cfe78b2b7bf9083d7a57618ef1e4e82614e19856d985451e9604bf835c0","observation_id":"2d2a09aa-0ff2-4b83-be11-fbb0cea23e00","resolution":{"observed_at":"2026-08-16T11:24:54.204474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11208","last_updated":"2024-09-21T23:17:45Z","snapshot_observed_at":"2026-08-16T22:17:34.185420Z","submitted_at":"2023-11-19T03:20:20Z","title":"LogicNet: A Logical Consistency Embedded Face Attribute Learning Network","version":2},"cited_work":{"arxiv_id":"2311.11208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.11208","snapshot_observed_at":"2026-08-16T11:24:53.777085Z","title":"LogicNet: A Logical Consistency Embedded Face Attribute Learning Network","venue":"cs.CV","work_id":"758a468d-ea3a-4696-95a3-1a005c2a2323","year":2023},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.614264Z"},"links":{"cited_paper":"/paper/2311.11208","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:047a71e11c8b272b6d5dc54383b7fd3b513b7de0e2d489f73e758f4939a8cd85","observation_id":"a3cd4719-bf61-4aa8-adaf-9bb01a8550ba","resolution":{"observed_at":"2026-08-16T11:24:53.781617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.189754Z","title":"A survey on facial emotion recognition techniques: A state-of-the-art literature review","venue":null,"work_id":"2d3f3e65-2c07-4ade-93bb-6a990de81afa","year":2022},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.617519Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:6aa77a7a94fd357f3b33a27a7e7ba0c2c2b78320124fcd8198494e43b02f05af","observation_id":"46f84d71-a489-4c1c-b696-7e3222d3e90a","resolution":{"observed_at":"2026-08-16T11:24:54.193361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.180241Z","title":"Semi-supervised multimodal emotion recognition with expression mae","venue":null,"work_id":"3ff6a683-bc6d-4262-a46f-3bf5d55d2e85","year":2023},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.620720Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:38b959ba4db5feb249b7969d466fcd3f065f9f94e5c6b4b50e69ae92dcc046ee","observation_id":"f8694d9f-42f0-4c95-a6d7-39fd5384e972","resolution":{"observed_at":"2026-08-16T11:24:54.183340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.170670Z","title":"Facial affective behavior analysis with instruction tuning","venue":null,"work_id":"b2030a53-b55d-439f-89fe-fd3f1b0b2de1","year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.623918Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:443707f02efded9595a5681849e4cf91cc30ba73e2bfd8f91df445b305f80c24","observation_id":"85958bd2-4e15-40b6-a613-541e04e46479","resolution":{"observed_at":"2026-08-16T11:24:54.173959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.160913Z","title":"Rank consistent ordinal regression for neural networks with application to age estimation","venue":null,"work_id":"8e8d7f56-1c01-4549-a0e3-2267a4d6452e","year":2020},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.627056Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:41b591de0973d1c3b0befc6e5881bdc94d8829f6d17e3897573ebddb4c77f7d1","observation_id":"600035e0-bcc6-4c88-9bf3-c4a140d7dd51","resolution":{"observed_at":"2026-08-16T11:24:54.164520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.151209Z","title":"Learning probabilistic ordinal embeddings for uncertainty-aware regression","venue":null,"work_id":"2353d72a-15f6-4b74-8835-4a5079903546","year":2021},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.630070Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:cbd286a76b057b05987e5701545624e048bb55634e0e183c4f865d94aeea42b1","observation_id":"5b11fdbf-9eba-4ba5-bd24-a68dfb55f365","resolution":{"observed_at":"2026-08-16T11:24:54.154732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.140103Z","title":"Mivolo: Multi-input transformer for age and gender estimation","venue":null,"work_id":"2f7a7361-1160-4f5b-8fb2-aa4c7991b1b4","year":2023},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.633220Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:5dfa932e7708a76892db5b6bed8f28f2392559666828dfacbbf7a6abcd952822","observation_id":"7c258d5d-b3d1-46c9-aa58-a3c01c25e9e9","resolution":{"observed_at":"2026-08-16T11:24:54.144228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:53.636220Z","title":"Hyperface: A deep multi-task learning framework for face detection, landmark localization, pose estimation, and gender recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.636220Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:1fc467ec34fcb2dc9c82ffff4d52b7f95881d46366bb49410c8b59265862d1eb","observation_id":"09de563e-7411-4cf6-8c47-55cad912aaa1","resolution":{"observed_at":"2026-08-16T11:24:53.636220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.123717Z","title":"An all-in-one convolutional neural network for face analysis","venue":null,"work_id":"e83d142e-4f64-4d52-844d-3d67a1cd2ea0","year":2017},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.639265Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:011d219cbe07f0d79cde82d0f5812d0978b39e8caee9bb191dfc5e4504528e55","observation_id":"bb8fb21e-56f1-4813-afad-4b20e01d60f4","resolution":{"observed_at":"2026-08-16T11:24:54.127688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.113913Z","title":"Swinface: a multi-task transformer for face recognition, expression recog- nition, age estimation and attribute estimation","venue":null,"work_id":"df25622e-b269-450d-a635-c2a5047080a3","year":2023},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.642253Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:66d56526fa705dcf3b68a15b26218fc12524da5950056ab6b557238b5180cf59","observation_id":"52f0af8c-fcb9-4e13-b428-b4f283db4b71","resolution":{"observed_at":"2026-08-16T11:24:54.117458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12960","last_updated":"2025-03-10T17:08:19Z","snapshot_observed_at":"2026-08-16T14:08:17.788021Z","submitted_at":"2024-03-19T17:58:04Z","title":"FaceXFormer: A Unified Transformer for Facial Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12960","snapshot_observed_at":"2026-08-16T11:24:53.645333Z","title":"Facexformer: A unified transformer for facial analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.645333Z"},"links":{"cited_paper":"/paper/2403.12960","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:ab351b08cb548a61fa2835b89cdbf542f7d9048d69537e84eb95577158258ef0","observation_id":"fb55f8b9-47e2-4037-a952-49f808459d89","resolution":{"observed_at":"2026-08-16T11:24:53.645333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09059","last_updated":"2024-05-15T03:13:11Z","snapshot_observed_at":"2026-08-16T13:52:37.681886Z","submitted_at":"2024-05-15T03:13:11Z","title":"Task-adaptive Q-Face","version":1},"cited_work":{"arxiv_id":"2405.09059","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.09059","snapshot_observed_at":"2026-08-16T11:24:53.753491Z","title":"Task-adaptive Q-Face","venue":"cs.CV","work_id":"19bdd146-e8b5-4985-95d1-3b5edc69f5f5","year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.648787Z"},"links":{"cited_paper":"/paper/2405.09059","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:8157125c4a52f0b5a2e6f6c49db9fcd0c072ad7239a1c8c4cb6b2ef733489268","observation_id":"43e2e7b7-187a-43aa-9f2a-b4f65d6778c3","resolution":{"observed_at":"2026-08-16T11:24:53.758113Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.103522Z","title":"Faceptor: A generalist model for face perception","venue":null,"work_id":"10c3dd1a-c40a-4419-ba1a-c39a1b83f5fd","year":2025},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.652112Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:5f5fee81827f672a834b83aa942652c09043bbf6481b041fccefcd473a818cbd","observation_id":"d437272b-b79c-4012-9640-ac647777b30e","resolution":{"observed_at":"2026-08-16T11:24:54.106799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.092966Z","title":"General facial repre- sentation learning in a visual-linguistic manner","venue":null,"work_id":"ac7824d7-9cfe-4c35-83ac-7c6c355ce40c","year":2022},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.655321Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:f2c27bce5fdcdc73f190574676357288df57b1dc905296dbb6bb1e91cdad8fe7","observation_id":"bd779c3d-f731-4559-90ad-299ee1948a9d","resolution":{"observed_at":"2026-08-16T11:24:54.096728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.082554Z","title":"Pre-training strategies and datasets for facial representation learning","venue":null,"work_id":"ca38a037-ec4b-427b-9367-099fd7e71465","year":2022},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.658443Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:ae293c5d26a2cdc3d1d4fd66ccfbbe2132aad02ae8b7014170960b91bb77aa80","observation_id":"4b4b9eb3-9661-4306-be4e-acd5399ff10e","resolution":{"observed_at":"2026-08-16T11:24:54.086240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.072756Z","title":"Label2label: A language modeling framework for multi-attribute learning","venue":null,"work_id":"70ea9c8b-8501-4f02-97de-657577a7e616","year":2022},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.661529Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:19c5e87c5deccec77df09e400a67d7159e06bf872ec67d05d1c00b82065daa5e","observation_id":"88648c52-8176-4120-ae86-e34ae78e2635","resolution":{"observed_at":"2026-08-16T11:24:54.076189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13382","last_updated":"2024-11-26T16:37:36Z","snapshot_observed_at":"2026-08-16T15:05:47.688298Z","submitted_at":"2023-08-25T13:52:05Z","title":"Prompting Visual-Language Models for Dynamic Facial Expression Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13382","snapshot_observed_at":"2026-08-16T11:24:53.664735Z","title":"Prompting visual-language models for dy- namic facial expression recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.664735Z"},"links":{"cited_paper":"/paper/2308.13382","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:746607d88574bcf2c705aa61ac4752d28026d3f06b2ddf9fbcdcd44b295c3b06","observation_id":"9515983b-4c42-4782-8dce-afc340cde691","resolution":{"observed_at":"2026-08-16T11:24:53.664735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.063065Z","title":"Emoclip: A vision-language method for zero-shot video facial expression recognition","venue":null,"work_id":"c317fbf3-b5f7-4cf8-8172-16260e712c53","year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.668204Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:527d50de9c2a37862b4e692864b56701b3a5296ac1f5a67ec1dea95ad2576495","observation_id":"4d431e98-8a95-426b-9ded-e41bdc4803c4","resolution":{"observed_at":"2026-08-16T11:24:54.066359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.053354Z","title":"Retinaface: Single-shot multi-level face localisation in the wild","venue":null,"work_id":"0436aae4-0599-458f-8d22-df1be41db555","year":2020},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.671306Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:072b1968cd55005de69faecae2e084bde06bfa263a2a796dd470940f07e11127","observation_id":"8da207b4-a2c3-42b2-8b5f-1a1e30d27f98","resolution":{"observed_at":"2026-08-16T11:24:54.056787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.043420Z","title":"Maad-face: A massively annotated attribute dataset for face images","venue":null,"work_id":"0d3ad8c0-00ad-4216-a932-3f9ca2611080","year":2021},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.674939Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:10e13254db625a2e0e40dbfb92497b8c20b939bc89cba53a41a32bcdc58da88e","observation_id":"2fbdaba1-7739-46d5-8c50-a6eb290f0146","resolution":{"observed_at":"2026-08-16T11:24:54.047060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:53.678340Z","title":"Deep learning face attributes in the wild","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.678340Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:d61b3d84cef4d78de07cc2128a4eed0f80a169d5001044c1da01cdee0fc51897","observation_id":"8b0f727b-f72f-45b4-95ba-f3e54be6c04c","resolution":{"observed_at":"2026-08-16T11:24:53.678340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.027804Z","title":"Fairface: Face attribute dataset for bal- anced race, gender, and age for bias measurement and mitigation","venue":null,"work_id":"9c835944-cdac-4b74-8f4f-ce9d6d17aa59","year":2021},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.681503Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:c35c5d58e50c4d9d9d8e8997d85f5c44acd3093c5c6de401bf755fff4ef2213d","observation_id":"e78ecc66-61c9-4768-aad5-573b583d5b0d","resolution":{"observed_at":"2026-08-16T11:24:54.031247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.017725Z","title":"Age progression/regression by con- ditional adversarial autoencoder","venue":null,"work_id":"b69e0ada-66b5-4569-8745-40a3b976e832","year":2017},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.684816Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:e45c504d5fdd5950451d2caedae4a787565d6c4b754f365562c837de48087253","observation_id":"8327ca4f-d382-44c7-a5c3-d3645559ba8c","resolution":{"observed_at":"2026-08-16T11:24:54.021080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:54.007679Z","title":"From facial expression recognition to interpersonal relation prediction","venue":null,"work_id":"1b6a3342-27ea-4885-9d38-07b1ee1cfb68","year":2018},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.688135Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:e5f3cc818304e79bcd33cf771006a808b75ddbdb603baf7cb3719bbb6b1f914a","observation_id":"9c0a7961-8e69-4445-8c39-1bd293f82873","resolution":{"observed_at":"2026-08-16T11:24:54.011284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:24:53.691170Z","title":"Reliable crowdsourcing and deep locality-preserving learning for expression recognition in the wild","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.691170Z"},"links":{"citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:ddfba8b56e60627850e87893d9d64cd3b6b1600fdedcb4fa50ad3aea114848cb","observation_id":"6a6cf00c-837f-4d91-860f-405e9671cc11","resolution":{"observed_at":"2026-08-16T11:24:53.691170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-16T11:24:53.694415Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.694415Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:7a1d7373a2d45ac951324ba8d8a1db5a281f2726a7ca1bb56e04c6703b53748a","observation_id":"dba4ae96-a1e2-4302-86c5-a641927a8ac5","resolution":{"observed_at":"2026-08-16T11:24:53.694415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-08-16T11:24:53.697821Z","title":"Nvila: Efficient frontier visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:24:53.697821Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2504.15624"},"observation_digest":"sha256:4b8a831d20b122eb0fb608464d9872c7e8069f98398f396dd81f09cb6d74bf8b","observation_id":"be532ca1-a559-4c2b-a969-e491e677ddb0","resolution":{"observed_at":"2026-08-16T11:24:53.697821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.15624","last_updated":"2025-04-25T18:58:49Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T23:19:11.620054Z","submitted_at":"2025-04-22T06:31:57Z","title":"FaceInsight: A Multimodal Large Language Model for Face Perception"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2504.15624."}