visAware

面向 NVDA 用户的视觉辅助插件,帮助你阅读书籍插图、浏览社交媒体内容,并协助完成复杂交互。

visAware 贯穿屏幕阅读器用户的真实使用场景:读文章、看图片、理解截图,也在必要时协助处理难以操作的界面。

当前状态

版本 0.6.4 发布 发布说明 开放源代码 GitHub 提供反馈 GitHub Issues

它能做什么

图像描述

为书籍插图、界面截图和社交媒体内容生成文字描述,并支持追问图片细节。

OCR 与数学公式识别

识别图片里的文字、图表或数理化公式等内容,并提供可交互的阅读方式。

协助交互

利用 AI Computer Use 技术,遵循用户指令协助操作计算机,适用于无障碍支持存在缺陷的自绘界面。

示例

以下摘录来自 visAware 对常见图片的描述。完整示例和图片来源见使用场景页。

默认描述不足以理解完整信息,可以追问图片细节 这是 visAware 在日常阅读里比较典型的用法。
高山峡谷,蜿蜒的河流和远处的雪山
风景描述 visAware 描述:高山峡谷风景。画面中央是一条蜿蜒的河流,从下方近处一路向远处延伸;左右两侧是高耸山体,远处群山连绵起伏。
Our World in Data 世界人口预测折线图
图表理解 visAware 描述:这是一张显示 1950 到 2100 年世界人口变化的折线图。2020 年之后曲线改为虚线,表示联合国中位情景下的未来预测。
一群人围在户外草地的木架旁
人物和活动 visAware 描述:一群穿着传统或复古服饰的人站在户外草地上围成一圈。支架旁边有一位长黑发男子,似乎正向众人讲解什么。

适合谁

visAware 适合使用 NVDA 屏幕阅读器的视觉障碍用户。

典型场景

别人发来的图片里有什么。

社交媒体上的图片如何理解。

用图片呈现的公式是什么。

未考虑无障碍的自绘界面如何操作。

原则

visAware 由视障者为视障者设计,提供实用功能和便捷的交互体验。