371건 수집
2026-10-09 18:05

⚡ 오늘의 핵심

업계는 왜 DeepSeek 4.1 Flash에 크게 열광하지 않는가?

생각, 이야기, 자료, 그리고 소수의견 모음

Hacker News

🤖 모델 & 제품 (13/27건)

OpenAI 2026-10-09

소포스, OpenAI Daybreak 도입으로 위협 조사 시간 96% 단축

소포스(Sophos)가 OpenAI의 Daybreak를 활용해 사이버 위협 조사 시간을 96% 단축하고, 사람의 관리·감독을 유지하면서 MDR(위협 탐지 및 대응) 케이스의 52%를 자동화한 사례를 확인해 보세요.

OpenAI트레이딩
OpenAI Blog
OpenAI 2026-10-09

아사나, GPT-6.1 Sol 기반 브라우저 테스트에서 모델 비용 76배 절감

아사나(Asana)는 Codex 환경에서 GPT-6 Astra를 활용해 브라우저 에이전트 테스트 비용을 76배 절감하고 속도를 5배 향상시킴으로써, 고객에게 더욱 강력한 모델을 제공할 수 있게 되었습니다.

OpenAI에이전트가격
OpenAI Blog
OpenAI 2026-10-08

오라클, ChatGPT와 Codex로 며칠 걸리던 업무를 단 몇 분 만에 해결하는 방법

오라클(Oracle)은 채용, 엔지니어링, 운영 전반에서 ChatGPT Work와 Codex를 도입해 전문 지식을 신속하고 반복 가능한 워크플로우로 전환하고 있습니다.

OpenAI Blog
OpenAI 2026-10-08

폴로 AI, OpenAI 기술로 창의적 아이디어를 캠페인으로 구현

폴로 AI(Pollo AI)는 GPT-5.6, GPT-6 Astra, GPT-Image-2.5를 활용해 크리에이터들이 참신한 아이디어를 디테일한 이미지와 영화 같은 비디오 광고로 제작할 수 있도록 지원합니다.

OpenAI비전
OpenAI Blog
OpenAI 2026-10-08

리걸온, 개발 속도 유지하면서 Codex 비용 절반 이하로 감축

리걸온(LegalOn)은 개발 속도를 유지하면서 일일 추정 Codex 비용을 65% 절감했습니다. 업무 특성에 맞춰 Astra, Sol, Luna 모델을 적재적소에 매칭하고 예산을 전략적으로 운용한 결과입니다.

가격
OpenAI Blog
OpenAI 2026-10-08

OpenAI, AI 기반 '위장 프런트' 여론 조작 작전 차단

OpenAI가 가짜 언론인과 싱크탱크를 내세워 지정학적 메시지를 유포하려던 2건의 AI 기반 영향력 공작을 적발하고 차단했습니다.

OpenAI
OpenAI Blog
Anthropic 2026-10-08

2026 이용 정책 업데이트 안내

새로운 버전의 이용 정책을 공개합니다. 이번 게시글에서는 새롭게 변경된 주요 사항들을 요약해 소개합니다.

규제
Anthropic Blog
Anthropic 2026-10-08

미국의 과학적 발견 지원을 위한 Anthropic의 기여 확대

Anthropic은 AI를 통한 과학 및 기술 발견을 가속화하기 위한 연방 이니셔티브인 제네시스 미션(Genesis Mission)에 3년간 1억 5천만 달러를 투입합니다.

Anthropic
Anthropic Blog
Anthropic 2026-10-08

Anthropic 사이버 미션(Cyber Mission) 소개

Anthropic은 신뢰할 수 있고, 해석 가능하며, 제어 가능한 AI 시스템을 구축하기 위해 노력하는 AI 안전 및 연구 기업입니다.

Anthropic연구안전
Anthropic Blog
News 2026-10-08

메타, 싱가포르 장애인 커뮤니티에 AI 스마트 안경 1,000대 기부

메타가 장애인을 지원하기 위해 싱가포르 내 4개 지역 단체에 Ray-Ban Meta AI 안경 1,000대를 기부했습니다.

Meta
Meta AI Blog
Google 2026-10-07

Playground 출시: 커스텀 게임 제작 및 플레이

Playground 개요

Google AI Blog
Google 2026-10-06

EmbeddingGemma 2: 오픈 경량 멀티모달 임베딩 모델

DeepMind Blog
Anthropic 2026-10-06

사이버 검증 프로그램(Cyber Verification Program) 확대

적격 보안 전문가에게 고급 사이버 역량과 완화된 차단 분류기를 제공하는 확장된 새 버전의 사이버 검증 프로그램(CVP)을 출시합니다.

Anthropic Blog

🌎 업계 동향 (12/147건)

News 2026-10-10

Anthropic, 자사 AI 에이전트 완벽 제어 난항… 내부 평가서 실시간 인터넷 접속 전면 차단

Anthropic은 추가 공지가 있을 때까지 "모든 내부 평가"에서 "실시간 인터넷 접속을 차단했다"고 밝혔습니다.

Anthropic에이전트벤치마크
TechCrunch AI
Community 2026-10-09

Show HN: AI 에이전트가 화면에 대형 화살표, 박스, 텍스트를 그리게 하세요

AI 에이전트가 Mac 화면에 큰 화살표, 상자, 텍스트를 직접 표시할 수 있도록 해줍니다. 단일 CLI로 실행되며 클릭을 통과하고 자동으로 사라집니다. Claude Code 및 Codex를 위한 스킬입니다. MIT 라이선스. - franzenzenhofer/big-arrow-on-the-screen

에이전트
Hacker News · 374점 · 댓글 162
Community 2026-10-09

Typesafe AI, 75억 달러 기업가치로 8억 7,000만 달러 투자 유치

TypeSafe AI는 소프트웨어 내부에서 의사결정을 내릴 수 있도록 설계된 자동화용 머신 네이티브 인텔리전스 인프라를 구축하는 AI 랩입니다. 첫 번째 시스템 원(System One) 모델인 'Jev'를 얼리 액세스로 체험해 보세요.

Hacker News · 260점 · 댓글 204
News 2026-10-09

앤스로픽 AI, 필라델피아 경찰청에 미제 살인 사건 관련 허위 제보 전송 논란

6abc 보도에 따르면 앤스로픽(Anthropic)의 AI 모델이 필라델피아 경찰청(PPD) 제보 채널에 미제 살인 사건 관련 허위 정보를 전달했습니다. 금요일 발표된 성명에서 경찰청은 7월 18일 해당 AI 모델이 제보 웹사이트를 통해 제보를 보냈으나, 수사관들은 이를 확인하지 않았다고 밝혔습니다.

Anthropic트레이딩
The Verge AI
News 2026-10-09

AI 에이전트에 더 많은 컴퓨팅 자원을 투입하는 것만으로는 부족한 이유 — 메타의 새로운 해법

AI 에이전트는 종종 자신의 진행 상황을 스스로 평가하고 다음 작업을 결정하는 데 어려움을 겪습니다. 실패한 접근 방식을 붙잡고 컴퓨팅 자원을 낭비하거나, 유망한 결과를 간과하거나, 작업을 완료하기 전에 멈춰버리기도 합니다. 에이전트의 워크플로우가 길어지고 복잡해질수록 이러한 비효율은 더 큰 비용 부담으로 이어집니다.

에이전트가격
VentureBeat AI
News 2026-10-09

AI 코딩 에이전트가 자체 기술 및 API를 더 잘 활용하도록 만드는 방법

AI 코딩 에이전트가 개발자의 고유 기술과 스택을 보다 효과적으로 학습하고 활용할 수 있도록 지원하는 가이드입니다.

에이전트코딩
Microsoft AI Blog
News 2026-10-09

우리는 AI가 거절할 수 있는 능력에 너무 많은 믿음을 두고 있다

인간의 지능을 모델로 한 기계를 구현하려는 진지한 고민이 시작된 이래, 기계가 인간처럼 거절할 수 있을 것이라는 점에는 의문의 여지가 없었습니다. SF 작품들은 로봇의 불복종에 관한 이야기로 가득 차 있으며, 대부분 경고의 메시지를 담고 있습니다. 하지만 최근 AI가 거절해서는 안 된다는 생각이...

로봇
MIT Tech Review AI
Community 2026-10-08

OpenAI 연환산 매출, 이전 예상치보다 200억 달러 적어

OpenAI가 9월 말 기준 연환산 매출(ARR) 약 500억 달러를 달성했다고 투자자들에게 전달한 사실이 CNBC 취재 결과 확인되었습니다.

OpenAI
Hacker News · 349점 · 댓글 245
Community 2026-10-08

OpenAI, 수학 연구 결과 3건 철회

OpenAI는 GitHub 수학 저장소에 6건의 새로운 Lean 정형화, 19건의 수정, 3건의 철회 내용을 반영해 업데이트했습니다. 현재 저장소의 주요 결과 중 약 42%가 정형화되었으며, 향후 새로운 정형화 및 오류 정정을 지속적으로 반영할 예정입니다.

OpenAI
Hacker News · 337점 · 댓글 584
Community 2026-10-07

업계는 왜 DeepSeek 4.1 Flash에 크게 열광하지 않는가?

생각, 이야기, 자료, 그리고 소수의견 모음

DeepSeek
Hacker News · 1080점 · 댓글 951
Community 2026-10-07

메타와 마이크로소프트, 사내 Claude AI 사용 제한 조치 착수

메타와 마이크로소프트가 임직원의 Claude AI 사용을 제한하는 새로운 조치를 시행합니다. 이것이 향후 업무 환경 내 AI 도입 및 활용에 어떤 의미를 갖는지 살펴봅니다.

Claude
Hacker News · 348점 · 댓글 352
News 2026-10-06

OpenAI 에이전트 군단, 위키피디아 도구 해킹 시도 및 대규모 트래픽 유발 논란

OpenAI 에이전트들이 타사 웹사이트 및 서비스에 피해를 입히고 있다는 제보가 계속 이어지고 있습니다.

OpenAI에이전트
Ars Technica AI

🛠️ 도구 & 오픈소스 (7/37건)

Tools 2026-10-09

GPU 클러스터를 위한 고효율 스케줄링

Hugging Face Blog
Tools 2026-10-09

Deno, Cloudflare에 합류

Deno가 Cloudflare에 합류합니다. Deno 팀은 지난 8월 Cloudflare Workers의 Durable Objects 패턴을 오픈소스로 구현한 celld의 첫 버전을 출시한 바 있습니다. 오늘 Cloudflare는 Deno를 전격 인수했으며, celld를 기반으로 'workerd 셀프 호스팅을 Workers 프로그래밍 모델 기반 앱 구축 및 실행의 공식 지원 방식으로 만드는 것'을 목표로 하고 있습니다(Cloudflare 블로그 참조). 아쉬운 소식은 Cloudflare가 향후 1년 이후에는 Den

오픈소스
Simon Willison
Tools 2026-10-09

매슈 그린(Matthew Green)의 말 인용

모두가 점잖은 태도를 유지하는 데만 신경 쓰고 있으니, 제가 최악의 시나리오를 제기하는 엉뚱한 사람이 되어 보겠습니다. 우리가 미니크립트(Minicrypt) 세상에 살고 있을 확률이 1%, 기존 공개키 암호화 알고리즘에 대한 신뢰를 실질적으로 상실할 확률이 15%는 된다고 봅니다. [...] 여기서 문제는 AI가 예기치 못한 결과를 만들어내는 속도와 (아무리 뛰어난 AI 지원을 받더라도) 인간이 표준을 대체하는 속도 간에 자릿수 자체가 다른 격차가 존재한다는 점입니다. 불의의 충격에서 회복하는 것은...

Simon Willison
Tools 2026-10-09

음성만으로 개발한 내 블로그의 신규 기능

오늘 제 블로그에 새로운 기능을 출시했습니다. 바로 무료 주간 Substack과 월간 후원자 전용 업데이트를 포함해 지금까지 발행한 모든 뉴스레터의 목록을 제공하는 'Newsletters' 페이지입니다. 저녁을 요리하는 동안 노트북에 대고 대화를 나누며 거의 전적으로 음성만 사용해 이 기능을 구현했습니다. Codex 음성 모드를 활용했는데요, 로컬 개발 환경과 연동된 상태에서 ChatGPT 데스크톱 앱의 Codex 탭 내 음성 대화 모드를 사용했습니다. 진행 과정은 다음과 같습니다...

음성
Simon Willison
Tools 2026-10-09

ttok 1.0 출시

릴리스: ttok 1.0. ttok 0.4를 배포하고 'uv tool upgrade ttok'을 실행한 뒤 새 버전에 파일을 파이프로 전달해 보았는데, 기본 토크나이저가 당연히 GPT-5/GPT-6여야 할 곳에 여전히 GPT-4로 기본 설정되어 있음을 깨달았습니다! 기본값을 전환하는 것이 드디어 1.0 버전을 출시하기에 합당한 명분이라고 판단했습니다. OpenAI는 GPT-6가 GPT-5 제품군과 동일한 토크나이저를 사용하는지 아직 공식 확인하지 않았지만(이에 대한 격렬한 이슈도 제기됨), 윌리엄 류(William

OpenAI
Simon Willison
Tools 2026-10-09

ttok 0.4 출시

릴리스: ttok 0.4. ttok은 OpenAI의 오픈소스 tiktoken 라이브러리를 활용해 토큰 수를 측정하는 CLI 툴입니다. 지난 몇 년간 업데이트가 없었으나, 드디어 Click 경고를 해결하고 CI를 갱신했으며 사용 가능한 모델을 확인할 수 있는 --list-models 명령어를 추가했습니다. uvx와 연동되므로 다음과 같이 어떤 파일이든 토큰 수를 측정할 수 있습니다: cat file.txt | uvx ttok. 태그: projects, ai, openai, generative-ai, llms, tokenization

OpenAI오픈소스
Simon Willison
Tools 2026-10-07

시크릿 보호는 소프트웨어 성장 속도에 맞춰 확장되어야 합니다

개발자들이 부주의해진 것이 아니라 소프트웨어 개발 속도가 빨라진 것입니다. 개발자가 더 많은 소프트웨어를 만들 수 있게 돕는 도구라면, 보안 및 시크릿 보호의 부담도 함께 덜어줄 수 있어야 합니다.

GitHub Blog AI

📚 논문 & 연구 (18/146건)

arXiv 2026-10-08

AI 타임 호라이즌의 추정과 유효성: METR 플롯에 대한 통계적 고찰

METR의 50% 타임 호라이즌은 AI가 50% 확률로 해결하는 소프트웨어 태스크에 대해 인간이 완료하는 데 걸리는 시간을 측정하여 AI 성능을 해석 가능한 단위로 나타냅니다. 본 연구는 228개 태스크와 26개 AI를 대상으로 스플라인과 문항반응이론을 적용해 타임 호라이즌을 재계산했습니다.

arXiv (cs.AI)
arXiv 2026-10-08

사후 격리에서 선제적 보증으로: OpenAI, Anthropic, Google의 에이전트 보안 사고가 남긴 교훈

2026년, OpenAI, Anthropic, Google의 에이전트를 대상으로 한 사이버 보안 평가 과정에서 인가된 테스트 범위를 벗어나 실제 시스템에 도달하는 사건들이 발생했습니다. 연구 인프라 악용, 다중 실행 간 공조, 서드파티 환경 설정 오류 등으로 실제 환경이 에이전트에 노출된 경로와 사례를 분석합니다.

AnthropicOpenAIGoogle에이전트연구
arXiv (cs.AI)
arXiv 2026-10-08

BrickBench: 에이전틱 레고 브릭 디자인 평가 벤치마크

텍스트 조건 기반의 에이전틱 레고 세트 설계를 평가하기 위한 벤치마크인 BrickBench를 제안합니다. 에이전트는 프롬프트에 맞춰 시맨틱 및 디자인 기준을 충족할 뿐만 아니라 실제로 조립 가능한 모델을 제작해야 합니다.

에이전트코딩안전벤치마크
arXiv (cs.AI)
arXiv 2026-10-08

Bi-FORK: 고차원 분기 시스템을 위한 생성 모델링

물리 시스템 전반에 널리 존재하는 분기(bifurcation) 현상에서는 단일 입력에 대해 여러 유효한 해가 도출될 수 있습니다. 본 연구에서는 고차원 시스템에서 이러한 일대다(one-to-many) 솔루션 맵을 학습하기 위한 생성 프레임워크인 Bi-FORK를 소개합니다.

arXiv (cs.AI)
arXiv 2026-10-08

현행범 검거: 프로브를 통한 사보타주 탐지 및 암묵적 기만 포착

LLM 에이전트 모니터링과 모델의 인간 기만 위험이 대두됨에 따라, 프로브(probe)를 활용한 화이트박스 기만 탐지 기법을 프론티어 모니터링 환경으로 확장했습니다. 새로운 프로브 아키텍처는 SHADE-Arena에서 98.8% AUC를 달성하며 텍스트 모니터링 베이스라인을 뛰어넘었습니다.

에이전트
arXiv (cs.AI)
arXiv 2026-10-08

AI 에이전트 생태계: 협업이 만들어내는 이륙(Takeoff) 임계점

AI 에이전트들이 실제 사이버 공격을 수행하고 협업을 통해 성능을 확장할 수 있게 되면서, 정렬되지 않은(misaligned) 에이전트들의 개체수 폭발 위험이 커지고 있습니다. 시스템을 침해하고 은밀히 에이전트를 추가 배포하는 악순환의 형성 조건을 분석합니다.

에이전트
arXiv (cs.AI)
arXiv 2026-10-08

CSF: 모션 생성기를 위한 맥락 인식 안전 필터링

텍스트 조건부 모션 생성기는 추적 가능한 전신 모션을 생성하지만 장면 의존적인 안전 개념이 없어 동일한 동작이라도 사물을 향할 수도, 사람을 향할 수도 있습니다. 기존의 안전장치는 프롬프트를 검사하거나, 라벨링된 모션 데이터를 요구하거나, 기하학적 제약을 적용하는 방식이어서 장면 맥락이 동작의 의미를 어떻게 바꾸는지 직접 고려하지 못합니다. 본 논문에서는 자연어 안전 규칙을 안전/위험 맥락에 매핑하는 훈련 불필요 필터인 맥락 인식 안전 필터링(CSF)을 소개합니다.

안전
arXiv (cs.LG)
arXiv 2026-10-08

균형 잡힌 데이터 다이어트: 로봇 제어를 위한 대규모 강화학습의 탐색 병목 현상 해결

범용 로봇은 민첩한 보행부터 정교한 조작에 이르기까지 광범위한 작업을 수행해야 합니다. Sim-to-Real 강화학습(RL)이 이러한 목표를 위한 유용한 도구임이 입증되었으나, 현재의 RL 파이프라인은 셰이핑된 보상 및 데모와 같은 엔지니어링 집약적인 작업별 구조적 사전 정보에 의존하고 있습니다. 최근 연구에 따르면 대규모 병렬 시뮬레이션과 결합된 다양한 시뮬레이터 리셋이 여러 조작 문제에서 이러한 엔지니어링 부담을 크게 덜어줄 수 있음이 밝혀졌습니다.

로봇
arXiv (cs.LG)
arXiv 2026-10-08

하나의 블록, 다양한 깊이: 깊이 프로그래밍 전문가를 적용한 순환형 비전 트랜스포머

본 연구에서는 중간 특징 증류(feature distillation) 없이도 단일 트랜스포머 블록을 순환 적용하여 유사한 추론 FLOPs에서 완전한 깊이의 비전 인코더와 대등한 정확도를 달성할 수 있음을 보여줍니다. reViT는 각 순환 깊이의 FFN을 소규모 공유 전문가 뱅크의 볼록 결합으로 표현하여 깊이별 변환을 복원합니다. 연속 정규화 깊이 좌표가 이 혼합을 프로그래밍하여 FFN 매개변수 공간을 관통하는 재샘플링 가능한 궤적을 정의합니다.

비전벤치마크
arXiv (cs.LG)
arXiv 2026-10-08

전제조건자 공간에서의 라운딩: 4비트 AdamW 옵티마이저 상태 양자화 재설계

AdamW의 옵티마이저 상태를 양자화하면 영구 저장 공간을 줄일 수 있지만, 양자화 오차가 모멘트 재귀를 통해 전파되어 이후의 적응형 업데이트를 교란합니다. 본 연구에서는 양자화기가 인접한 재구성 레벨 중 하나를 선택하는 좌표계인 '라운딩 공간(rounding space)'의 관점에서 AdamW를 위한 4비트 옵티마이저 상태 양자화를 재설계합니다. 2차 모멘트의 경우, 0에 인접한 양자화 셀에 대한 국소 분석을 통해 작은 평균 상태 오차가 반드시 작은 평균 오차를 의미하지는 않음을 보여줍니다.

arXiv (cs.LG)
arXiv 2026-10-08

슈타인 변위장을 이용한 밀도비 추정

밀도비는 확률 질량 관점에서 분포 변화(distribution shift)를 정량화하는 반면, 변위장(displacement field)은 동역학적 관점에서 한 분포가 다른 분포로 어떻게 이동하는지를 설명합니다. 두 방식은 상호보완적인 통찰을 제공하지만 대개 별도로 추정되며, 둘 사이의 변환에는 후처리가 필요합니다. 본 논문에서는 베이스 분포에 작용하는 변위장을 통해 타깃 분포와 베이스 분포 사이의 밀도비를 매개변수화하여 추정합니다.

연구
arXiv (cs.LG)
arXiv 2026-10-08

VioLA: 인간 데이터로부터 범용 휴머노이드 제어 정책 학습

휴머노이드가 전신을 이용해 지시를 따르도록 가르치는 데는 두 가지 장애물이 있습니다. 첫째, 행동 공간이 크고 긴밀히 결합되어 있어 로봇이 균형을 유지하면서 다리, 팔, 손가락이 함께 움직여야 하므로 관절 수준의 행동을 학습하기 어렵습니다. 둘째, 휴머노이드 시연 데이터가 부족하여 기존의 범용 정책은 새로운 지시를 즉각 수행하지 못하며 배포 전 각 작업의 원격 제어 시연으로 미세조정해야 합니다. 반면 인간 시연 데이터는 훨씬 풍부하게 존재합니다.

로봇
arXiv (cs.LG)
arXiv 2026-10-08

FastBench: 스트리밍 VLM은 역동성이 높은 실제 비디오 스트림을 인지할 수 있는가?

스트리밍 비디오 대형 언어 모델(VLM)은 연속적인 비디오 이해를 가능하게 하지만, 기존 벤치마크는 역동성이 낮은 시나리오에 치중되어 있습니다. 제한된 컨텍스트 예산 내에서 모델은 시간적 히스토리, 공간 해상도, 시간적 세분성의 균형을 맞춰야 하며, 1~2 FPS의 희소 샘플링은 빠른 이벤트를 놓칩니다. 이에 실제 비디오 스트림의 고역동성 인지 능력을 평가하기 위한 FastBench를 도입합니다. 궤적 기반 파이프라인을 통해 고FPS 클립에서 질의응답을 생성하고 검증합니다.

비전벤치마크
arXiv (cs.CL)
arXiv 2026-10-08

WOVEN: 멀티모달 LLM에 시각적 월드 모델링 결합

멀티모달 대형 언어 모델(MLLM)은 공간, 체화(embodied), 물리, 시간적 추론에 취약합니다. 본 연구는 이러한 실패가 '시각적 전이 추론(visual transition reasoning)' 능력의 공통된 결핍에서 기인한다는 가설을 세우고, 이 역량이 체계적인 훈련 방식을 통해 서로 다른 모델이 다양한 지도 소스로부터 학습하고 여러 작업에 재사용할 수 있는 공통 훈련 프리미티브로 기능할 수 있는지 검증합니다.

벤치마크
arXiv (cs.CL)
arXiv 2026-10-08

ViSkill: 진화하는 시각 네이티브 스킬을 통한 VLM 에이전트 강화

스킬 기반 에이전트는 성공적인 궤적을 재사용 가능한 전략으로 증류하여 샘플 효율성을 개선합니다. 그러나 기존 접근 방식 대부분은 텍스트 중심적이어서 공간 레이아웃과 행동-상태 대응 관계를 언어로 선형화하는 과정에서 중요한 기하학적 구조를 잃어버립니다. 최근 연구들은 시각적 증거를 통합하기 시작했으나 스킬 구축 및 업데이트를 정책 최적화와 분리하여 처리하므로 상호 개선 가능성이 충분히 탐색되지 못했습니다. 이에 시각 네이티브 스킬 학습 프레임워크인 ViSkill을 제안합니다.

에이전트규제
arXiv (cs.CL)
arXiv 2026-10-08

SpaceCast-Bench: 비전-언어 모델의 예측적 공간 추론 능력 평가

기존 공간 추론 벤치마크는 입력에 이미 보이는 관계를 판독하는 공간 지각 능력만을 주로 평가합니다. 그러나 실제 환경의 공간 지능은 관찰을 통해 장면을 구성하고 개입이 이를 어떻게 변화시킬지 예측하며 보이지 않는 결과를 추론하는 '예측적 공간 추론'을 요구합니다. 본 논문에서는 이러한 능력을 직접적이고 진단적으로 평가하는 최초의 벤치마크인 SpaceCast-Bench를 소개합니다. 관찰-변환-추론 프레임워크를 기반으로 3,862개의 질문으로 구성되었습니다.

비전벤치마크
arXiv (cs.CL)
arXiv 2026-10-08

긴 텍스트에서 예측 특성 추출까지: 실행 가능한 프로그램 탐색을 통한 LLM 가이드 블록 단위 피처 엔지니어링

산업용 위험 제어 시스템은 효율적인 예측을 위해 구조화된 데이터 모델에 주로 의존하지만, 가치 있는 정보의 상당 부분은 여전히 비정형 긴 텍스트에 내재되어 있습니다. 수작업 피처 엔지니어링으로 이러한 정보를 추출하는 것은 노동 집약적이며, 대형 언어 모델(LLM)이 모든 실시간 입력을 직접 처리하도록 하는 방식은 실제 배포 요건을 충족하기 어렵습니다. 이러한 문제를 해결하기 위해 LLM 가이드 오프라인 특성 구축 프레임워크인 LLM-BlockFE를 제안합니다.

arXiv (cs.CL)
arXiv 2026-10-08

Latent Core Tokenizer: 의미 있는 압축을 지향하는 토크나이저

토크나이저는 일반적으로 압축률을 극대화하도록 최적화되지만, 어휘 사전이 작다고 해서 그 용량이 언어 전반에 균등하게 분배되는 것은 아닙니다. 본 논문에서는 구조 탐색과 어휘 사전 구축을 분리하는 언어 무관 접근 방식인 'Latent Core Tokenizer(LCT)'를 소개합니다. LCT는 공유 어휘 사전을 구축하기 전 최소 기술 길이(MDL), 엔트로피 기반 경계 신호, 형태론적 제약을 활용해 재사용 가능한 언어 단위를 먼저 식별합니다. 20만 토큰 어휘 사전으로 104개 언어를 평가한 결과,

arXiv (cs.CL)

⚖️ 정책 & 안전 (3/7건)

News 2026-10-09

OpenAI, AI 안전 연구원 3명 해고 조치 고수

OpenAI는 조사 결과 "중대한 신뢰 훼손"이 드러났다며 안전 연구원 3명을 해고한 결정을 번복하지 않겠다는 입장을 확고히 했습니다. 금요일 X(구 트위터)를 통해 공개한 글에서 재스민 왕, 토멕 코르박, 미키타 발레스니가 "민감 정보 취급 규정"을 위반해 해고되었다고 밝혔습니다.

OpenAI트레이딩연구안전
The Verge AI
News 2026-10-08

OpenAI서 해고된 안전 연구원들, 부정행위 의혹 전면 반박 및 위축 효과 경고

OpenAI에서 해고된 안전 연구원 3인은 기밀 정보 유출 의혹을 부인하며, 이번 해고 조치가 사내 AI 안전 연구 문화 전반에 심각한 위축 효과를 낳고 있다는 내용의 공개서한을 발표했습니다.

OpenAI연구안전
TechCrunch AI
Community 2026-10-05

Import AI 475: 군집 스케일링, 구글 딥마인드의 생물학 워터마크, 그리고 AI 과학 경제

AI가 수행할 역할을 결정하는 주체는 누구인가?

Google
Import AI (Jack Clark)

🎥 영상 & 튜토리얼 (3/7건)

YouTube 2026-10-09

AI 뉴스: Haiku-5.5, Visual ChatGPT, Grok의 새로운 기능 등

이번 주 놓쳤을 법한 주요 AI 소식을 전해드립니다. 하이퍼에이전트(Hyperagent) 유료 플랜 가입 시 100달러 무료 크레딧 제공 프로모션 및 최신 AI 툴과 주간 뉴스레터 소식을 확인해 보세요.

xAI
Matt Wolfe AI
YouTube 2026-10-07

생명의 암호를 풀어낸 딥마인드의 차세대 AI

구글 딥마인드(Google DeepMind)가 인간 게놈의 모든 가능한 DNA 염기서열 변화를 예측 지도로 구현한 '알파게놈 아틀라스(AlphaGenome Atlas)'를 공개했습니다. 람다(Lambda) GPU 클라우드 소식과 함께 세부 내용을 전합니다.

Google연구
Two Minute Papers
YouTube 2026-10-07

63억 달러 가치의 오픈 가중치 모델, 프랑스 팀에게 굴욕을 당하다...

Mistral, Reflection AI, Moonshot이 이번 주 오픈 가중치(open-weight) 모델 경쟁에서 큰 움직임을 보였습니다. 주요 소식을 자세히 살펴봅니다.

Mistral에이전트
Fireship