スキル一覧に戻る
co-labs-co

ios-vision-ocr

by co-labs-co

Central skills repository for ContextHarness - curated agent skills and workflows

0🍴 0📅 2026年1月12日
GitHubで見るManusで実行

SKILL.md


name: ios-vision-ocr version: 0.1.0 author: cmtzco description: iOS Vision Framework OCR for text recognition from images. When to use: when extracting text from images, implementing document scanning, building photo analysis features, working with VNRecognizeTextRequest, or processing captured photos. What problems it solves: provides accurate on-device text recognition, supports multiple languages, handles image preprocessing, and processes images efficiently.

iOS Vision OCR

Overview

The Vision Framework's text recognition capabilities enable iOS apps to extract text from images and photos. This skill covers setting up VNRecognizeTextRequest, configuring image handlers, processing recognition results, and handling different image sources.

Identified Patterns

The following patterns were identified in this codebase that this skill addresses:

Pattern 1: Text Recognition Request Setup

  • Location: DadBrain/DadBrain/ViewModels/PhotoScanner.swift
  • Description: VNRecognizeTextRequest initialization with configuration
  • Frequency: 1 complete implementation

Pattern 2: Image Handler Processing

  • Location: DadBrain/DadBrain/ViewModels/PhotoScanner.swift
  • Description: VNImageRequestHandler for processing captured images
  • Frequency: 1 complete implementation

Pattern 3: Result Extraction

  • Location: DadBrain/DadBrain/ViewModels/PhotoScanner.swift
  • Description: Processing VNRecognizedTextObservation results
  • Frequency: 1 complete implementation

TODO: Implementation

This skeleton skill needs Phase 2 refinement. Areas to develop:

Workflow Instructions

  1. Import Vision framework
  2. Configure VNRecognizeTextRequest with recognition level
  3. Create VNImageRequestHandler from image data
  4. Perform recognition request
  5. Extract and process text results

Best Practices

  • Choosing recognition accuracy levels
  • Handling multiple text regions
  • Processing images efficiently
  • Supporting multiple languages

Common Pitfalls

  • Forgetting to set recognition level
  • Not handling image orientation
  • Processing very large images (performance)
  • Missing camera permission

Suggested Resources

Based on codebase analysis, consider adding:

Scripts (scripts/)

  • vision-text-extractor.swift - Standalone text extraction utility
  • ocr-test-generator.swift - Test image generator for OCR

References (references/)

  • vision-framework-guide.md - Apple's Vision Framework documentation
  • text-recognition-config.md - VNRecognizeTextRequest configuration options
  • image-preprocessing.md - Preparing images for optimal OCR results

Assets (assets/)

  • recognition-templates/ - Different recognition scenarios
  • test-images/ - Sample images for testing OCR

Evidence from Codebase

FilePatternRelevance
DadBrain/DadBrain/ViewModels/PhotoScanner.swiftComplete Vision OCR integrationFull implementation with result processing
DadBrain/DadBrain/Resources/Info.plistCamera permissionsNSCameraUsageDescription, NSPhotoLibraryUsageDescription

Refinement Priority

Score: 6.6/10 Priority: Medium

Refinement Tasks

  1. Research Vision Framework documentation
  2. Create vision-text-extractor script
  3. Document recognition level options
  4. Add examples for different image sources
  5. Create optimization guide for performance

Skeleton generated by ContextHarness /baseline Run Phase 2 skill refinement to complete implementation

スコア

総合スコア

60/100

リポジトリの品質指標に基づく評価

SKILL.md

SKILL.mdファイルが含まれている

+20
LICENSE

ライセンスが設定されている

+10
説明文

100文字以上の説明がある

0/10
人気

GitHub Stars 100以上

0/15
最近の活動

3ヶ月以内に更新がある

0/10
フォーク

10回以上フォークされている

0/5
Issue管理

オープンIssueが50未満

+5
言語

プログラミング言語が設定されている

+5
タグ

1つ以上のタグが設定されている

0/5

レビュー

💬

レビュー機能は近日公開予定です