{"as_of":"2026-08-09T09:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c91cd5b81b0f889c6c2f0f4d8bfbfdf8989e592f60a79679ca7ab9fa0e8a89a3","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T09:12:18.878396Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T05:51:18.233043Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T05:55:25.079559Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"cited_work":{"arxiv_id":"2601.14569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.14569","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Social caption: Evaluating social understanding in multimodal models","venue":null,"work_id":"20407ed9-7431-4c54-8a9f-9c3a2214c2d9","year":2026},"citing_paper":{"arxiv_id":"2605.15764","last_updated":"2026-05-15T09:24:41Z","snapshot_observed_at":"2026-07-06T23:27:01.213106Z","submitted_at":"2026-05-15T09:24:41Z","title":"GRASP: Learning to Ground Social Reasoning in Multi-Person Non-Verbal Interactions","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-20T18:49:18.815456Z"},"links":{"cited_paper":"/paper/2601.14569","citing_paper":"/paper/2605.15764"},"observation_digest":"sha256:fc608237dfc4a98ac2ff8ec19f6b73aa6ad3e4a749504ec1580cd708994ac5c7","observation_id":"e515ec7e-621d-40b8-b710-4a71ac713d42","resolution":{"observed_at":"2026-06-03T02:05:12.627191Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"cited_work":{"arxiv_id":"2601.14569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.14569","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Social caption: Evaluating social understanding in multimodal models","venue":null,"work_id":"20407ed9-7431-4c54-8a9f-9c3a2214c2d9","year":2026},"citing_paper":{"arxiv_id":"2605.19859","last_updated":"2026-05-21T18:05:34Z","snapshot_observed_at":"2026-07-06T23:30:30.141040Z","submitted_at":"2026-05-19T13:50:40Z","title":"Eyes on VLM: Benchmarking Gaze Following and Social Gaze Prediction in Vision Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T05:57:45.964145Z"},"links":{"cited_paper":"/paper/2601.14569","citing_paper":"/paper/2605.19859"},"observation_digest":"sha256:c3ea45edef13a9ff4a9904b0e0865f12ff7a42ec66ca854eb33a1fdf0e70d866","observation_id":"b96db208-5bbc-4bb3-903d-e9a99cdc28d1","resolution":{"observed_at":"2026-06-03T02:05:12.627191Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"cited_work":{"arxiv_id":"2601.14569","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2601.14569","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Social caption: Evaluating social understanding in multimodal models","venue":null,"work_id":"20407ed9-7431-4c54-8a9f-9c3a2214c2d9","year":2026},"citing_paper":{"arxiv_id":"2605.19859","last_updated":"2026-05-21T18:05:34Z","snapshot_observed_at":"2026-07-06T23:30:30.141040Z","submitted_at":"2026-05-19T13:50:40Z","title":"Eyes on VLM: Benchmarking Gaze Following and Social Gaze Prediction in Vision Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T05:51:18.233043Z"},"links":{"cited_paper":"/paper/2601.14569","citing_paper":"/paper/2605.19859"},"observation_digest":"sha256:aba3af5536907c1e6ba8513a1554ac8d4378cdb3c21857c4ff2fbdce5a1408be","observation_id":"16b9b18a-d6ea-4207-af82-0f36ae949baf","resolution":{"observed_at":"2026-06-03T02:05:12.627191Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2601.14569/citation-record","integrity":"/paper/2601.14569/integrity","json":"/paper/2601.14569/citation-record.json","paper":"/paper/2601.14569"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.243516Z","title":"-Facial Expressions:Describe any notable facial expressions or emotions displayed by the individual throughout the video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.243516Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:c4e079497b832914172f474bfbc839c85ff1bfed89aba4e7bbb32c2abf7720ea","observation_id":"d364eb55-f5c5-432d-b6aa-1c2c74488944","resolution":{"observed_at":"2026-08-03T09:12:18.243516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.366771Z","title":"Include the following information in your description: Transcription:{Transcription}","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.366771Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:44e79b81888d3a80ea4e1b44e3f113335655e1db1810af49279f4a86eb0bfdb7","observation_id":"62ef00b7-2761-4d09-bafc-f0c05855584c","resolution":{"observed_at":"2026-08-03T09:12:18.366771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.511299Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.511299Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:c6e310a7b9adf52b891ef50c86f4558c9918e8adabf0ddf2a909368d03e7947e","observation_id":"006c0cfe-c367-465a-9c6a-6bd5b543458d","resolution":{"observed_at":"2026-08-03T09:12:18.511299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.160322Z","title":"Jin Xu, Zhifang Guo, Jinzheng He, Hangrui Hu, Ting He, Shuai Bai, Keqin Chen, Jialin Wang, Yang Fan, Kai Dang, Bin Zhang, Xiong Wang, Yunfei Chu, and Junyang Lin","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.160322Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:b38571e9f99565829515e28709904d7e326016399c9ee9c1ebdae9c4550be4f7","observation_id":"f1105a34-faa8-48f1-8214-db8722b92830","resolution":{"observed_at":"2026-08-03T09:12:18.160322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00484","last_updated":"2025-08-30T12:50:55Z","snapshot_observed_at":"2026-08-08T21:44:59.595016Z","submitted_at":"2025-08-30T12:50:55Z","title":"VideoRewardBench: Comprehensive Evaluation of Multimodal Reward Models for Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00484","snapshot_observed_at":"2026-08-03T09:12:18.190583Z","title":"w/o trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.190583Z"},"links":{"cited_paper":"/paper/2509.00484","citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:55b28c1577e9956b040d7cd9a89488825c7aef21cde331d0338c58b6cda4b0e3","observation_id":"b67f1f99-ad3a-43e0-975b-10d945926009","resolution":{"observed_at":"2026-08-03T09:12:18.190583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.379012Z","title":"-Time of Day:Mention the time of day if it is evident from the video (e.g., morning, afternoon, evening)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.379012Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:b4e4704051aad338ae13d63d1f270dfbaba70f0247d0d3931c9b8fdbc421707d","observation_id":"366ac333-06c4-443f-9945-9065faa23bfa","resolution":{"observed_at":"2026-08-03T09:12:18.379012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.396398Z","title":"-Facial Expressions:Describe any notable facial expressions or emotions displayed by the individual throughout the video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.396398Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:5f0b997dfd2309a7cdbc9a0c8d8514f5c1c250fa5e9aaea718458f387ab08721","observation_id":"ee848fd4-e4ea-42f0-82ba-96792b48fc48","resolution":{"observed_at":"2026-08-03T09:12:18.396398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.408533Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.408533Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:3f11d697125595244170abe98949a161709a9747445b172f120c55ac9c4d28a9","observation_id":"5c22e2ac-8762-4b26-94e5-d52cd696fb18","resolution":{"observed_at":"2026-08-03T09:12:18.408533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.418928Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.418928Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:a0141fab72f032170f4508cfe1d694e4a935900337d960d20aa232fa4861a154","observation_id":"7cc6087a-8f0b-4fba-92f0-b8e0d8bf035e","resolution":{"observed_at":"2026-08-03T09:12:18.418928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.437234Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.437234Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:2c8d6feeabcc8094145a3fa4db9dbff40be9ad28e764a03de1c8b0c3b4a59c52","observation_id":"4a7da728-191d-4e39-8947-3ae7b0479df0","resolution":{"observed_at":"2026-08-03T09:12:18.437234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.471440Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.471440Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:b1bfd7132e52451f5d48e383720abc43c2eb07db3bf22d26b10591fe60d1a989","observation_id":"30c52079-1cc7-4c3c-bb16-faae50444498","resolution":{"observed_at":"2026-08-03T09:12:18.471440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.547409Z","title":"scene_description","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.547409Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:21657f2609fba88d3c711fcccfde5771d71f85d5d7f5451a1fc1854696c7fe7a","observation_id":"98ae386e-0a45-4c76-b129-870217903f22","resolution":{"observed_at":"2026-08-03T09:12:18.547409Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.584592Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.584592Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:3d89fa21be641ceac2f080fa6c7624f799843b81027a79234182d3c9eea919c2","observation_id":"4c7c81e0-83d5-43f0-be19-8779801c5497","resolution":{"observed_at":"2026-08-03T09:12:18.584592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.607245Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.607245Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:dfc609d0557fb67b96ce0b51f05d811d10bdfbceeb025629125741bc6319a73e","observation_id":"ef02e45f-82f8-47c2-b2ea-faae40a607e5","resolution":{"observed_at":"2026-08-03T09:12:18.607245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.644467Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.644467Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:a1dc5ea7f00b4af33b9ef656b176e9919eaa7650617ae04c3a8539562989ca71","observation_id":"4c788b52-24d1-45ef-ae45-32ee6591849e","resolution":{"observed_at":"2026-08-03T09:12:18.644467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.677938Z","title":"In your description, focus on the elements of the video that are most relevant to answering the question","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.677938Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:c5506799b20df27c850aadee5cef8a13edb17a80fc70a128f7d047c47ab4ea4f","observation_id":"8565fdb8-7c55-4d03-b5e3-12aad5a3d4fc","resolution":{"observed_at":"2026-08-03T09:12:18.677938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.706433Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.706433Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:e24918b098f8c0e0c32b5a802219b510bbd9865d2a37a24db7cf08a522f8b47b","observation_id":"4a1dbadf-0dba-480e-be5a-7356f9a7fa60","resolution":{"observed_at":"2026-08-03T09:12:18.706433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.743647Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.743647Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:c62d04deefdbbccb864d5ebcd432348247d702e77af2c0ac7e82d278998a9ac1","observation_id":"99b201b1-98e9-4a4a-a997-01d9dafabfbb","resolution":{"observed_at":"2026-08-03T09:12:18.743647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.786199Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.786199Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:2acdb6981f491cf83353adf3064757c83919446a48370532d9bc9f9dc5fee44f","observation_id":"6cae4e8b-2124-4d8b-9cd6-66a783fb96b3","resolution":{"observed_at":"2026-08-03T09:12:18.786199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.818800Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.818800Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:a0e1dc9717c7f21049e3d2298d3680f90c5839f3873d3747ad86c0b56718c117","observation_id":"015ba25a-3f41-49e9-b431-5367ac946a28","resolution":{"observed_at":"2026-08-03T09:12:18.818800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.844177Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.844177Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:23187fa9207f789da55c03146e32f084ba5a2a97f3f470cfbd7c23515857da08","observation_id":"63d5235a-0a1f-440a-bd05-6f95e95449a3","resolution":{"observed_at":"2026-08-03T09:12:18.844177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T09:12:18.878396Z","title":"relevant_scene_details","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.878396Z"},"links":{"citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:36d32abf5e834fc2fc786c7a8ae92178328328190fe159777b9fcc3a1dd565a5","observation_id":"0d4aa28e-eb38-4aa6-b7de-128fab6557d2","resolution":{"observed_at":"2026-08-03T09:12:18.878396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-03T09:12:18.115923Z","title":"Version: Current month(s) and year(s) of use","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.115923Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:90f97c9d10ac817daf82015c7103069239e4aeaa8afc58a9a043d7cc38cff66e","observation_id":"8c5fcb20-3217-474e-8464-07178baeb630","resolution":{"observed_at":"2026-08-03T09:12:18.115923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-07-06T19:18:17.523057Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-03T09:12:18.037151Z","title":"InProceedings of the 2018 con- ference on empirical methods in natural language processing, pages 1369–1379","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.037151Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:610a3e6a131022f900e2d154c9903e549e593a1937e886f5e31bf10137de106c","observation_id":"30140cd9-f595-41b2-a384-a90470bebc5a","resolution":{"observed_at":"2026-08-03T09:12:18.037151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-03T09:12:18.004428Z","title":"Aaron Hurst, Adam Lerer, Adam P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.004428Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:90374129188196add5e7ce46d245da466b4cdc97eddab78c801b4815aaf5cca4","observation_id":"76e5af11-27af-453a-8f23-36a13d5574ee","resolution":{"observed_at":"2026-08-03T09:12:18.004428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13403","last_updated":"2025-05-19T17:37:39Z","snapshot_observed_at":"2026-08-07T15:43:01.179446Z","submitted_at":"2025-05-19T17:37:39Z","title":"MR. Judge: Multimodal Reasoner as a Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13403","snapshot_observed_at":"2026-08-03T09:12:18.079856Z","title":"Renjie Pi, Felix Bai, Qibin Chen, Simon Wang, Jiu- long Shan, Kieran Liu, and Meng Cao","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:18.079856Z"},"links":{"cited_paper":"/paper/2505.13403","citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:0da4f5e8e4da12909f6a97645ab5ae86193e7450f6fe1f2b56fe50d81300e146","observation_id":"b03eea5d-6002-423c-84ae-c531a8a73fbe","resolution":{"observed_at":"2026-08-03T09:12:18.079856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-03T09:12:17.976239Z","title":"Sture Holm","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T09:12:17.976239Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2601.14569"},"observation_digest":"sha256:bd529c3f1f8637e76e92fe76678ce1e14ccfbdb573de43666af9e8ebb80438c3","observation_id":"5e4a01e4-c3fc-4946-b264-ae320c2a9b16","resolution":{"observed_at":"2026-08-03T09:12:17.976239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.14569","last_updated":"2026-06-01T20:36:47Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T09:12:16.567435Z","submitted_at":"2026-01-21T01:10:42Z","title":"Social Caption: Evaluating Social Understanding in Multimodal Models"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 3 inbound Pith citation observations for arXiv:2601.14569."}