{"as_of":"2026-08-08T09:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a337c74a2cacae2a63c43d447ae2b9213d0979f61fd2cd762825abc57c59ad30","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:15:49.702336Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.16762/citation-record","integrity":"/paper/2508.16762/integrity","json":"/paper/2508.16762/citation-record.json","paper":"/paper/2508.16762"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.502637Z","title":"To- wards measuring and modeling “culture” in LLMs: A sur- vey","venue":null,"work_id":"172f0954-360b-4928-8188-d5b296e2cb80","year":2024},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.487041Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:24633ad2811bd5f01c1a1686debbc36b8ea0419c3ec1aa81a6c52b714f24dbe1","observation_id":"b2c894af-23a1-4d9e-874a-f1d50757802f","resolution":{"observed_at":"2026-08-05T17:15:50.507144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13231","last_updated":"2024-07-06T12:23:56Z","snapshot_observed_at":"2026-08-04T08:14:00.913283Z","submitted_at":"2024-02-20T18:47:28Z","title":"Investigating Cultural Alignment of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13231","snapshot_observed_at":"2026-08-05T17:15:49.496287Z","title":"Investigating cultural alignment of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.496287Z"},"links":{"cited_paper":"/paper/2402.13231","citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:402aebe64f4f1115fd7cde5472274f048f1b7f47719a2fd8642d85e55e91efd2","observation_id":"e6385693-90d8-416f-9ec7-ffe9cbb1395b","resolution":{"observed_at":"2026-08-05T17:15:49.496287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13722","last_updated":"2025-08-28T17:30:05Z","snapshot_observed_at":"2026-07-06T12:52:34.302457Z","submitted_at":"2022-03-25T15:45:49Z","title":"Probing Pre-Trained Language Models for Cross-Cultural Differences in Values","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13722","snapshot_observed_at":"2026-08-05T17:15:49.502065Z","title":"Probing pre-trained language models for cross-cultural dif- ferences in values","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.502065Z"},"links":{"cited_paper":"/paper/2203.13722","citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:bd9f8c6e8effeed52e7efe9e68f91eb0398bde5d496ecb49593d38a28b7fb6db","observation_id":"e26cacf3-710f-4600-b4af-5286c44cab1c","resolution":{"observed_at":"2026-08-05T17:15:49.502065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.483213Z","title":"Probing pre-trained language models for cross-cultural dif- ferences in values","venue":null,"work_id":"2c52720a-81bf-4539-a3b6-b6934b3d4ba9","year":2023},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.511930Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:4190bc7b4d2c8097aa2252935e8650466913a467ff06910b1fec8600ffa25d22","observation_id":"eeff2b56-5420-42a3-a3ee-a0d9ff2c354e","resolution":{"observed_at":"2026-08-05T17:15:50.488957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.465268Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":"b7694de9-c3b5-4992-af28-d465eb4d6b19","year":2025},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.518870Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:793ed5d1f0f02339871100a67e6876cd700dbb042ff37d05a198fc3cb8473946","observation_id":"66a2cf49-afc4-4e96-b9ad-aeec69601ceb","resolution":{"observed_at":"2026-08-05T17:15:50.470713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.445867Z","title":"Venkatesh Babu, and Danish Pruthi","venue":null,"work_id":"ab991fb4-292d-498c-83d3-ebadbd9f2a2b","year":2023},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.526751Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:c12db64fefd7b458d30e20ebc582e901392d7953ca28ce3563e072aaa7cff2c5","observation_id":"4f13b1f1-b300-4206-8e75-309ffe398716","resolution":{"observed_at":"2026-08-05T17:15:50.451398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.429562Z","title":"From local concepts to univer- sals: Evaluating the multicultural understanding of vision- language models","venue":null,"work_id":"6d59987e-6999-4646-864b-b78cf99ffe3b","year":2024},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.534440Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:70a735cfba14e82199903ce9ee27cd656a05eed2452a3812546cb9d8c142d354","observation_id":"91957dbb-4d85-4206-aead-d19ce5c8ec25","resolution":{"observed_at":"2026-08-05T17:15:50.434223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.414794Z","title":"Extrinsic evaluation of cultural competence in large language models","venue":null,"work_id":"c840702f-267e-4016-8ff3-ca64e9877525","year":2024},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.540424Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:48b7433dc5372373e5359c53c3ca7568d2ba4096dee0f5e6334ea0ba772276ac","observation_id":"97432fa6-e243-42be-9367-9868606a8645","resolution":{"observed_at":"2026-08-05T17:15:50.419391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.255227Z","title":"Language (technology) is power: A critical sur- vey of “bias” in NLP","venue":null,"work_id":"7765183d-a426-4f3b-982a-1714114a9c1b","year":2020},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.545812Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:f40f37f377754ddfab70599b00afaeec925f5c2c4c431424e8a21419cdaeda3a","observation_id":"ce25a871-4a72-407e-9cf4-76306ed76a63","resolution":{"observed_at":"2026-08-05T17:15:50.400342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17466","last_updated":"2023-03-31T15:02:48Z","snapshot_observed_at":"2026-07-06T15:10:08.462773Z","submitted_at":"2023-03-30T15:43:39Z","title":"Assessing Cross-Cultural Alignment between ChatGPT and Human Societies: An Empirical Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17466","snapshot_observed_at":"2026-08-05T17:15:49.550399Z","title":"Assessing cross-cultural alignment between chatgpt and human societies: An empirical study","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.550399Z"},"links":{"cited_paper":"/paper/2303.17466","citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:4c01ee0a3d4d18e250e1979b4902eafd074ef74a816e9639c267b615c77d8a63","observation_id":"b419d52b-e392-4a3a-9732-fd291315fdf8","resolution":{"observed_at":"2026-08-05T17:15:49.550399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.239135Z","title":"MaXM: Towards multilingual visual question an- swering","venue":null,"work_id":"4e278281-ef90-4895-85e7-7b91464d669f","year":2023},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.556238Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:3cf1af4f96853a964df55b59897b749cfcea50b4936f45de8cf79e07f2c745a6","observation_id":"9f93418e-cef3-412c-af0f-cd8c33a085aa","resolution":{"observed_at":"2026-08-05T17:15:50.244100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.212991Z","title":"The SAGE handbook of intercultural competence","venue":null,"work_id":"cc6cc125-ffc8-4a27-be6b-a78dfe385d92","year":2009},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.566255Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:8dd9ac749e1c6f6801a9b8cec7d466d0fd5f010fb8c208f21d8daf3e37a099fa","observation_id":"bd15319a-ccc5-41a6-b263-edc9fac94030","resolution":{"observed_at":"2026-08-05T17:15:50.217411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16388","last_updated":"2024-04-12T00:05:53Z","snapshot_observed_at":"2026-07-30T00:01:16.818092Z","submitted_at":"2023-06-28T17:31:53Z","title":"Towards Measuring the Representation of Subjective Global Opinions in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16388","snapshot_observed_at":"2026-08-05T17:15:49.570715Z","title":"Towards measuring the representation of subjec- tive global opinions in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.570715Z"},"links":{"cited_paper":"/paper/2306.16388","citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:753846d108251ed4af97ec7a825f9778f98070b9a9b803f9e738fd362e3347c9","observation_id":"44af451b-f7bc-47fb-ac35-773a8126fcff","resolution":{"observed_at":"2026-08-05T17:15:49.570715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.196936Z","title":"”i wouldn’t say offensive but...”: Disability-centered perspectives on large language models","venue":null,"work_id":"6b2a3bbe-73e8-4b2a-8335-a89e0a4d127c","year":2023},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.575968Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:72791b5253be8a7baa078d7923733323e540ddc786b1f9a69df70d4247f23ca2","observation_id":"f5c7ff0f-a9b3-41d4-9292-2a671d4991b2","resolution":{"observed_at":"2026-08-05T17:15:50.201890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.177498Z","title":"World values survey: Round seven - country-pooled datafile version 5.0, 2022","venue":null,"work_id":"7c45ddc3-3304-467a-a0ea-5fcd3683a3be","year":2022},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.581681Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:ae653abe0e095a131d110fe92419e767007dbd9aa81d598da364fadcb995306d","observation_id":"36a82315-2055-48ba-be2e-18e18cb78857","resolution":{"observed_at":"2026-08-05T17:15:50.183490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.157622Z","title":"Challenges and strategies in cross- cultural NLP","venue":null,"work_id":"f38552db-68cd-4592-8346-5ff9d775f689","year":2022},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.586036Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:c9a9048fe0cfbe9f44f57a1ede6b1fb7fd50c938078c264e6c740aa490882fb4","observation_id":"6a98888b-6b7f-41f2-9525-77fb27da3e41","resolution":{"observed_at":"2026-08-05T17:15:50.161813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.143014Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning, 2022","venue":null,"work_id":"1848439e-04f4-4e4e-898a-1c4fb044e307","year":2022},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.591603Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:996e7e66e7512b75572755f54bcd1f3713be6ffa008e0cf2afd99c90a3574a81","observation_id":"ab7e2c3b-6d81-492f-8621-97fa4e3f144a","resolution":{"observed_at":"2026-08-05T17:15:50.147569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.129529Z","title":"Dimensionalizing cultures: The hofstede model in context","venue":null,"work_id":"0fc581ca-2b7a-4c01-9b92-c0ae1acc24fc","year":2011},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.601101Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:46e6796688cdc21a06cb04d2ec1b22c77aa7f840661f0e3f747014e6ca1eb6fa","observation_id":"8a2bcde3-1a01-4517-bc7d-f93ac753c396","resolution":{"observed_at":"2026-08-05T17:15:50.133979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16019","last_updated":"2024-12-03T16:18:10Z","snapshot_observed_at":"2026-08-02T20:55:07.319348Z","submitted_at":"2024-04-24T17:51:36Z","title":"The PRISM Alignment Dataset: What Participatory, Representative and Individualised Human Feedback Reveals About the Subjective and Multicultural Alignment of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16019","snapshot_observed_at":"2026-08-05T17:15:49.605724Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.605724Z"},"links":{"cited_paper":"/paper/2404.16019","citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:c30da6074d705044ef1d0639e78620ed204da96a010d16f3bfe707db939deeb5","observation_id":"07b5b54a-1e3c-40a4-961c-e0fe3acb6855","resolution":{"observed_at":"2026-08-05T17:15:49.605724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.115980Z","title":"Visually 9 grounded reasoning across languages and cultures","venue":null,"work_id":"5901873d-21c2-46cc-8ee7-93b0c7a45a99","year":2021},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.613174Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:226bf321c74c53d008837f5422834f110d6869e00102cc1c62e7ef59023f2f4c","observation_id":"51157317-dd22-42c3-8893-0d9745f895a1","resolution":{"observed_at":"2026-08-05T17:15:50.120240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.101202Z","title":"Wong, Qing- song Wen, Lichao Sun, Haipeng Chen, Xing Xie, and Jin- dong Wang","venue":null,"work_id":"90ff689d-7832-4495-a4a0-18dc5c655c82","year":2025},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.619857Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:d659811c7a41ad90caa8f66a953c834f4e580a223cdbdddbd93c87ffae30636d","observation_id":"7b1f3961-56ea-4081-9caa-e6ffaeb19ea3","resolution":{"observed_at":"2026-08-05T17:15:50.106486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.083974Z","title":"Smolvlm: Re- defining small and efficient multimodal models, 2025","venue":null,"work_id":"4b6393cf-a8e0-45a4-9d3f-83f8c3fffbc2","year":2025},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.624563Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:6c3ddb7b865984e30bc8bc93049266bb3841ffff53633ccd5b25a27ed43b6d05","observation_id":"feb9ebcd-dc92-4475-8b1b-1c7fc41cec29","resolution":{"observed_at":"2026-08-05T17:15:50.089084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12342","last_updated":"2024-05-08T14:48:39Z","snapshot_observed_at":"2026-07-06T16:22:01.657709Z","submitted_at":"2023-08-25T14:50:13Z","title":"Cultural Alignment in Large Language Models: An Explanatory Analysis Based on Hofstede's Cultural Dimensions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12342","snapshot_observed_at":"2026-08-05T17:15:49.632259Z","title":"Cultural alignment in large language models: An explanatory analysis based on hofst- ede’s cultural dimensions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.632259Z"},"links":{"cited_paper":"/paper/2309.12342","citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:8c0e65bb2f9d27e97e9e7a5dcc6545a84801df05041ccd2b94a020e3af245565","observation_id":"382ea78f-496d-486c-b6c1-0567dd6a0531","resolution":{"observed_at":"2026-08-05T17:15:49.632259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.065101Z","title":"Assessing demographic bias in named entity recognition, 2020","venue":null,"work_id":"d26519bc-1733-47bb-a9d3-f7bcf8bd2346","year":2020},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.638211Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:ac5835f2052e9e656af54ae96963f095d28aa11908be6320f7da0b980e2d6d87","observation_id":"b035525d-fed5-4b4d-b39f-9d007f0fa8ef","resolution":{"observed_at":"2026-08-05T17:15:50.071548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.048511Z","title":"Benchmarking vision language models for cultural understanding","venue":null,"work_id":"8912f4d5-dec6-45a3-8443-8140b7e77a51","year":2024},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.642962Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:f557ac3f2a0670ebf74c789d8e6a1cdc2e7c54df6c65b3984fd5c48da8a08a75","observation_id":"e4b1d5bd-0ba2-4192-bea4-f45810b8508b","resolution":{"observed_at":"2026-08-05T17:15:50.053582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.026339Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"60a8d240-3628-494b-b257-b494ff8cc983","year":2002},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.647539Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:1fc0ccfd056560ff14d99a3fc2a65f235904fc35d6d5d7d552718af80bf383cf","observation_id":"56c09c94-b480-49b8-b306-f218cdf8f666","resolution":{"observed_at":"2026-08-05T17:15:50.034075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01857","last_updated":"2023-06-02T18:23:35Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T18:23:35Z","title":"Knowledge of cultural moral norms in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01857","snapshot_observed_at":"2026-08-05T17:15:49.655207Z","title":"Knowledge of cultural moral norms in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.655207Z"},"links":{"cited_paper":"/paper/2306.01857","citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:49ddce7a9875d7229b8637a26955f4503899d7f127e0814d7be30f424104f879","observation_id":"6f975014-75c2-46a3-9868-a7711e77cba0","resolution":{"observed_at":"2026-08-05T17:15:49.655207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:50.002807Z","title":"Normad: A benchmark for measuring the cultural adaptability of large language mod- els","venue":null,"work_id":"391325c7-48ec-453d-9cb6-b68ba8768dc7","year":2024},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.664060Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:da239d61538220200c352e4d8c32e740060c5d9a8e3c499691df066182159dad","observation_id":"1694d9d3-b235-4ed8-beb3-5dc8c4667c2c","resolution":{"observed_at":"2026-08-05T17:15:50.007915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:49.981640Z","title":"Cvqa: culturally-diverse multilingual visual question answering benchmark","venue":null,"work_id":"a225c217-5a0b-4141-aab7-5c598f50208f","year":2025},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.669594Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:95b63a59eeca20b37a7eb8adffe61162cc66fe657f3137623b3f6834167eb6e6","observation_id":"bcbf7f3f-335a-4d07-8dfa-752d6484d6a3","resolution":{"observed_at":"2026-08-05T17:15:49.988507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:49.964238Z","title":"Geographical erasure in language generation","venue":null,"work_id":"e600a32d-bf46-42ed-b254-cf04bdb676f2","year":2023},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.676360Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:a2eca1cd6e259252fd94ec05086411ffd6807b88f662a638da1910a2c43a2b00","observation_id":"4caac69a-eeaa-4e52-9984-a26eca4641b5","resolution":{"observed_at":"2026-08-05T17:15:49.969879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:49.948783Z","title":"Cultural bias and cultural alignment of large language mod- els","venue":null,"work_id":"b5ebae3f-df04-4bd6-93be-4a6550f8e079","year":2024},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.683290Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:202f5c4d1a1d866ee6f3159ed2a28df7b8a30aa49e5cf73092740b5e39832b26","observation_id":"8ea07621-8980-4273-b82c-8f15f33284f4","resolution":{"observed_at":"2026-08-05T17:15:49.953680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:49.928634Z","title":null,"venue":null,"work_id":"acd18de6-c60d-41d1-aeed-b8173c9f7ecc","year":2025},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.689074Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:9d5ae5328cb36fa7825bcb926a4b891a0cdadfb4cadb48d7ac2c182ee2551967","observation_id":"79701dd4-3670-4960-82c9-139fbec99289","resolution":{"observed_at":"2026-08-05T17:15:49.933681Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:49.909082Z","title":"Broaden the vision: Geo-diverse visual com- monsense reasoning","venue":null,"work_id":"79bcac01-44fb-4c94-bf99-556d47f7b912","year":2021},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.694750Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:3f0353e59cb8109c5b5374bbce609c3a6c0ae0537fdf240d365063651784c2d3","observation_id":"cc5f8c52-4426-499d-8f33-852afcc446fe","resolution":{"observed_at":"2026-08-05T17:15:49.914244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:49.889012Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models, 2025","venue":null,"work_id":"b177fd6e-8514-44d9-bb54-c6e277605d72","year":2025},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.702336Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:32ed13c2e70305552d97715401c44e1d1075f4637cb592b2adca2b7007d4b774","observation_id":"76a60ec6-aed8-4285-85f8-955bc4c04e0c","resolution":{"observed_at":"2026-08-05T17:15:49.897339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:15:49.561069Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T17:15:49.561069Z"},"links":{"citing_paper":"/paper/2508.16762"},"observation_digest":"sha256:76f8ffdf5b6098396e0b960f56b66bfed9aefe1a012bfebbf7e0be3409d787bd","observation_id":"0e39aa5f-683e-468c-932e-56a15a210dc5","resolution":{"observed_at":"2026-08-05T17:15:49.561069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.16762","last_updated":"2025-08-22T19:39:02Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T17:15:44.354191Z","submitted_at":"2025-08-22T19:39:02Z","title":"Toward Socially Aware Vision-Language Models: Evaluating Cultural Competence Through Multimodal Story Generation"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2508.16762."}