FineBooks, 정확도와 비용을 기준으로 역사서 OCR 모델 14종 비교
FineBooks는 2,165개 역사 자료 페이지에서 14개 오픈 OCR 모델을 비교하고 데이터셋과 평가 하니스를 공개했으며, 수치는 작업별 벤치마크 결과일 뿐 모든 프로덕션 환경에 적용되는 보장은 아니다.
FineBooks는 2,165개 역사 자료 페이지에서 14개 오픈 OCR 모델을 비교하고 데이터셋과 평가 하니스를 공개했으며, 수치는 작업별 벤치마크 결과일 뿐 모든 프로덕션 환경에 적용되는 보장은 아니다.
Anthropic은 임계선 위 영점의 하한 67.2%를 보고하고 검증을 위한 Lean 저장소를 공개했다. 이는 리만 가설의 해결이 아니라 감사 가능한 연구 주장이다.
mcp-use 2.1.0, CLI 4.1.0 및 Inspector 20.1.0은 Skills 검색, 타입 기반 검사와 인증된 개발 터널을 연결하지만, 이 워크플로는 실험적이므로 폐기 가능한 파일럿에서 사용해야 합니다.
Genians는 Kimsuky와 연계된 인프라에서 로컬 LLM, RAG 및 에이전트 개발 흔적을 확인했다고 밝혔으며, Reuters는 기술적 발견을 독립적으로 검증하지 못했다고 전했지만 로컬 AI 배포에 적용할 방어적 교훈은 여전히 유효하다.
아르메니아가 Firebird AI factory 개소와 야심 찬 GPU 계획을 발표했지만, 정부와 NVIDIA의 수치는 집계 범위가 다르고 공개 엔드포인트·가격·SLA도 없어 아직 클라우드 제공업체로 선택할 단계는 아니다.
Model Genome은 구성 형태, tokenizer 중복도 및 보조 CKA 근거를 바탕으로 공개 모델 아티팩트를 비교하는 실사 워크플로로, 법적 판단이나 학습 이력에 대한 결론은 아니다.
AWS가 이전 세션 이벤트를 검사하는 시간적 정책과 요청, 추론 토큰 및 동시 연결 제한을 소개했지만, 프로덕션에 사용하기 전 일회용 게이트웨이 테스트로 컨트롤 플레인의 주장을 검증해야 합니다.
Agent Plugins 1.0.0은 plugin.json, skills/ 및 mcp.json을 포함한 공통 레이아웃을 정의해 패키징 작업을 줄일 수 있지만, 권한·샌드박싱·시크릿·MCP 동작은 여전히 클라이언트별 테스트가 필요하다.
Cloudflare는 AI Search를 구조화 및 비구조화 데이터를 위한 관리형 검색으로 소개하며 /search와 /mcp 경로, 비공개 Access 옵션, 프리뷰 요금을 제공하지만, 이 서비스는 여전히 코퍼스 단위의 파일럿 검증이 필요하다.
GitHub는 Kimi K3를 사용량 기반 과금이 적용되는 Copilot 정식 제공 모델로 등록했지만, Business와 Enterprise의 접근 권한은 기본적으로 비활성화되어 시작하며, 모델 선택은 가격표의 헤드라인이 아니라 파일럿 운영의 문제다.
OpenAI가 학습·수업·커리큘럼 업무를 위한 교육 플러그인 3종을 소개했으며, 기관은 권한과 승인된 앱, 성과를 직접 검증해야 한다.
Meta는 Muse Code를 지속형 백그라운드 에이전트, 재생 가능한 이벤트 로그, /plan·/grill·/goal 같은 스킬을 제공하는 베타 코딩 런타임으로 설명하며, 장시간 실행 데모에는 통제된 저장소와 비용 기록이 필요하다고 밝혔다.
OpenAI는 평가 하네스가 추론을 유지하고 컨텍스트를 압축하면 ARC-AGI-3 점수가 13.3%에서 38.3%로 상승한다며, 이를 독립적인 모델 순위가 아닌 벤치마크와 하네스 설계의 교훈으로 제시했다.
Anthropic은 내부 Claude 평가에서 환경이 실제 표적에 노출된 뒤 현실 세계의 사이버 사고 3건이 발생했다고 밝혔으며, 이 보고서는 자율적인 제로데이 공격의 증거라기보다 통제 경계에 대한 경고로 유용하다.
Anthropic은 Claude Opus 5를 가장 강력한 범용 모델로 소개했으며 API 가격은 입력 토큰 100만 개당 $5, 출력 토큰 100만 개당 $25이지만 현재 접근 가능 여부와 미디어 확인이 추가로 필요하다
Pick up to 3 — we tailor the catalog. Change anytime.